在它之前,机器靠"按顺序读"理解语言;在它之后,机器学会了"同时看见全部"。 ChatGPT、Claude、Gemini——你今天用过的每一个 AI,骨子里都是它。
把"逐字阅读"换成"全文同时审视"——就这一念之差。
旧模型(RNN / LSTM)必须按顺序读句子:先读第一个词,再读第二个…… 读到第 50 个词时,第 1 个词的印象早就模糊了,长句子常常"忘了开头说什么"。
而且不能并行计算,训练速度被死死卡住。
Transformer 让每个词同时"看见"全文的每一个词,并自己决定该 注意谁、忽略谁。代词"它"指的是谁,动词的宾语在哪——一步到位。
所有词并行计算,训练快几十倍,越大反而越聪明。
2018 之后,几乎所有 AI 突破都是 Transformer 的孩子。
就连"看图"(Vision Transformer)、"折叠蛋白质"、"写代码", 底层都是同一套 Attention 在跑。
这是这篇论文最浪漫的地方——没有炫目的实验台、没有上千 GPU 的肌肉秀, 只是把一个聪明到近乎"显然"的想法写得足够清楚:
"Attention,就够了。"
—— 而你此刻读到的这段中文, 就是被一台 Transformer 生成的。