前Windows核心开发者Dave Plummer在一台47年前的PDP-11/44电脑上,成功跑起了Transformer模型,用6MHz的CPU和64KB内存完成了AI训练。这台机器上跑的是一个叫ATTN-11的模型,由Damien Boureille用PDP-11汇编语言写的,是个单层、单头的Transformer,只有1216个参数。



这个模型的任务听起来很简单:输入一串数字,输出它反过来的顺序。但要完成这个任务,模型必须自己学会序列反转的结构规则。Plummer觉得,这恰恰抓住了ChatGPT这类现代大模型工作的本质。

为了在这么有限的硬件上跑起来,ATTN-11做了大量极致优化,前向传播的精度被压缩到8位定点数,每一个CPU周期都精打细算。最后Plummer靠一块缓存板,在大约350轮训练后让模型达到了100%的准确率,整个过程用了大概3.5分钟。

Plummer在视频里描述训练过程时说,模型一开始很蠢,损失值很高,然后在某个时刻权重开始收敛,注意力机制发现了反转的映射规律,机器跨过了那条从猜测到认知的无形界线。

他的核心观点是,现代AI的本质不是什么神秘力量,就是机器反复更新几千个加权连接的强度,让下一次答案比上一次稍微不那么错一点。Plummer最后指出,随着算力越来越成为瓶颈,那些能回归极致效率和优化的公司,在未来的AI竞争中会更有优势。