《Attention Is All You Need》(2017年)

译自英文

《Attention Is All You Need》是2017年由八位谷歌研究人员发表的机器学习论文,提出了基于注意力机制的深度学习模型Transformer架构。该论文已成为现代AI系统(包括大型语言模型)的基础,截至2026年被引用超过25万次。

《Attention Is All You Need》是一篇2017年发表的机器学习研究论文,作者为八位供职于谷歌的科学家和工程师。该论文引入了一种名为Transformer的新型深度学习架构,其基础是2014年由Bahdanau等人提出的注意力机制。论文所描述的Transformer方法已成为包括大型语言模型在内的各类人工智能系统的主要架构。当时,研究的重点是改进用于机器翻译的Seq2seq技术,但作者在论文中更进一步,预见了该技术在问答以及如今所谓的多模态生成式人工智能等其他任务上的潜力。

团队尝试其Transformer架构的一些早期示例包括英德翻译、生成关于“Transformer”的维基百科文章以及句法分析。这些尝试使团队确信,Transformer是一种通用语言模型,而不仅仅擅长翻译。截至2026年,该论文已被引用超过25万次,跻身21世纪被引用次数最多的十篇论文之列。论文由谷歌发表后,八位作者均离开了公司,或加入其他公司,或创办初创企业。

背景

该论文的作者是Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Lukasz Kaiser和Illia Polosukhin。八位作者均为论文的“同等贡献者”;所列顺序是随机排列的(根据论文本身所述)。论文发表后,每位作者都离开了谷歌,或加入其他公司,或创办初创企业。

论文标题是对披头士乐队歌曲《All You Need Is Love》的引用。“Transformer”这个名字的选定是因为论文作者之一Jakob Uszkoreit喜欢这个词的发音。一份早期设计文档的标题为“Transformers: Iterative Self-Attention and Processing for Various Tasks”,其中包含一幅来自《变形金刚》系列的六个角色的插图。该团队被命名为Team Transformer。

讨论与介绍的方法

该论文最广为人知的是引入了Transformer架构,该架构构成了大多数现代大型语言模型的基础。现代大多数LLM偏好此架构的一个关键原因是其相对于前代架构的可并行性。这确保了训练所需的操作可以在GPU上加速,从而既能缩短训练时间,也能训练更大规模的模型。

论文在开发Transformer架构的过程中引入了以下机制。

缩放点积注意力与自注意力

使用缩放点积注意力和自注意力机制,而非循环神经网络或长短期记忆网络(它们依赖循环),可以带来更好的性能,如下段所述。论文将缩放点积注意力描述如下:

Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value

其中Query、Key、Value分别是查询、键、值矩阵,d_k是值的维度。由于模型依赖的Query、Key和Value矩阵来自同一来源(即输入序列或上下文窗口),这消除了对RNN的需求,完全确保了架构的可并行性。这与2014年引入的注意力机制的原始形式有所不同。此外,论文还讨论了使用一个额外的缩放因子,该因子在键向量的维度(表示为d_k,论文中初始设为64)方面被发现最为有效,如上式所示。在论文重点关注的翻译这一特定语境中,Query和Key矩阵通常以对应源语言的嵌入表示,而Value矩阵则对应目标语言。

多头注意力

在自注意力机制中,查询(Q)、键(K)和值(V)为每个输入序列(通常受上下文窗口大小限制)动态生成,使模型能够在不同步骤关注输入序列的不同部分。多头注意力通过引入多个并行的注意力头来增强这一过程。每个注意力头学习Q、K和V矩阵的不同线性投影。这使得模型能够同时捕捉序列中词语之间关系的不同方面,而非仅关注单一层面。通过这样做,模型可以关注不同位置的不同表示子空间中的信息,从而提升其处理复杂语言模式的能力。

位置编码

论文引入了Positional Encoding,以注入关于序列中词元位置的信息,因为该架构本身并不按顺序处理词元。作者提出使用不同频率的正弦和余弦函数来编码位置,使模型能够学习相对位置。这一机制已成为基于Transformer的模型的标准做法,不过后来的变体探索了学习嵌入或其他方法。

其他创新

论文还讨论了使用Layer Normalization残差连接来稳定训练,以及使用Dropout进行正则化。这些组件与注意力机制相结合,构成了Transformer块的基础。作者在机器翻译任务上训练了他们的模型,在训练时间上比循环模型更快,并取得了当时最先进的结果。

影响与遗产

论文发表后,Transformer架构迅速成为自然语言处理领域的主导方法。它支撑了由OpenAIGoogle DeepMindAnthropic等组织开发的主要系统,包括GPT和BERT等大型语言模型。该架构也被应用于文本之外的领域,影响了计算机视觉和音频处理等领域。论文的影响力体现在其引用次数上,截至2026年已超过25万次,使其成为计算机科学领域被引用次数最多的作品之一。

论文发表后不久,八位作者全部离开谷歌,这促成了包括Cohere和Inceptive在内的数家AI初创公司的创立,并为基于Transformer的技术的更广泛商业化做出了贡献。论文标题对披头士歌曲的引用,以及团队俏皮的命名惯例,已成为AI领域的一部分。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·transformer·research-paper·artificial-intelligence
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史