AKL AI CLUB BETA ← 前沿导读
FRONTIER · 模型内部

注意力就是你所需要的一切

Attention Is All You Need

Vaswani 等 8 人 Google Brain / Google Research · 引用超十万次的奠基论文
2017
为什么选它今天所有大模型的共同祖先。GPT、Claude、Gemini、LLaMA、DeepSeek 全是它的后代。不必啃公式,但自注意力、多头、位置编码这三个词,你在后面每一篇论文里都会反复遇到。

今天所有大模型的共同祖先。这篇论文提出了 Transformer 架构,而 GPT、Claude、Gemini、LLaMA、DeepSeek——全都是它的后代。

在它之前,处理语言的主流是循环神经网络:像人读书一样一个词一个词地扫过去,前一个词处理完才能处理下一个。这带来两个致命问题——没法并行(所以训练慢),以及距离一远就记不住(隔了几十个词的关联会衰减)。

Transformer 的做法是把循环整个扔掉,只留下自注意力机制:句子里的每个词,直接和其它所有词两两计算「我该多关注你」的权重。「它」指代的是前面哪个名词?不用一路回溯,一步就能连上。因为词与词之间不再有先后依赖,整句话可以同时算完——这一点直接打开了大规模并行训练的大门,而算力能堆上去,才有了后来的一切。

论文标题里那句略带挑衅的话(「你只需要注意力」)后来成了 AI 圈玩不厌的梗,但它确实说的是实情:作者们发现把当时公认必需的循环和卷积全部去掉之后,效果反而更好。

怎么读。如果你没有深度学习背景,不必硬啃公式。抓住三个概念就够用:自注意力(每个词看所有词)、多头(同时从多个角度看,有的头管语法,有的头管指代)、位置编码(因为并行处理丢掉了词序,得额外把位置信息加回去)。这三个词你在后面所有论文里都会反复遇到。
Transformer自注意力多头注意力位置编码
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文arXiv:1706.03762 · Attention Is All You Need →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。