FOUNDATIONAL · PAPERS · NO.01
2017 · NeurIPS
01 / 03 THE PAPER Vaswani et al. Google Brain

Attention
is all
you need. —— 一篇 8 页的论文,重写了机器学习此后十年的剧本。

在它之前,机器靠"按顺序读"理解语言;在它之后,机器学会了"同时看见全部"。 ChatGPT、Claude、Gemini——你今天用过的每一个 AI,骨子里都是它。

被引次数(截至 2026) 150,000+
发表场合 NeurIPS · 2017
它给出的架构 Transformer
A. Vaswani · N. Shazeer · N. Parmar · J. Uszkoreit
L. Jones · A. N. Gomez · Ł. Kaiser · I. Polosukhin
02 / 03 THE IDEA 它到底做了什么

那么,这篇论文做了什么

把"逐字阅读"换成"全文同时审视"——就这一念之差。

BEFORE · 2017 之前

像念课文,
一个字一个字。

旧模型(RNN / LSTM)必须按顺序读句子:先读第一个词,再读第二个…… 读到第 50 个词时,第 1 个词的印象早就模糊了,长句子常常"忘了开头说什么"。

而且不能并行计算,训练速度被死死卡住。

北京 天安门
↓ 越往后,开头越模糊

AFTER · Self-Attention

像看整张
地图。

Transformer 让每个词同时"看见"全文的每一个词,并自己决定该 注意谁、忽略谁。代词"它"指的是谁,动词的宾语在哪——一步到位。

所有词并行计算,训练快几十倍,越大反而越聪明。

小猫 老鼠 "它"自动注意到 "老鼠"——指代消解一步搞定
03 / 03 THE AFTERMATH 从一篇论文到一整个时代

然后,一切都长在它上面

2018 之后,几乎所有 AI 突破都是 Transformer 的孩子。

Transformer · 2017
BERT
2018 · 编码器
Google · 让搜索看懂句子
GPT 系列
2018+ · 解码器
OpenAI · 催生 ChatGPT
T5
2019 · 编+解
Google · 万物皆翻译
Claude
2023+ · LLM
Anthropic · 你正在用的这个
Gemini
2023+ · 多模态
Google DeepMind
AlphaFold 2
2020 · 蛋白质
DeepMind · 助攻诺奖

就连"看图"(Vision Transformer)、"折叠蛋白质"、"写代码", 底层都是同一套 Attention 在跑。

≈8 页 改写了之后的十年

这是这篇论文最浪漫的地方——没有炫目的实验台、没有上千 GPU 的肌肉秀, 只是把一个聪明到近乎"显然"的想法写得足够清楚:

"Attention,就够了。"

—— 而你此刻读到的这段中文, 就是被一台 Transformer 生成的。

完 · FIN   按 ← 回看
Space 翻页