《Attention Is All You Need》(2017年)

译自英文

2017年谷歌的一篇研究论文,介绍了Transformer架构,该架构采用自注意力机制,并成为大多数现代大型语言模型的基础。

《Attention Is All You Need》是一篇2017年发表的机器学习研究论文,由八位在谷歌工作的科学家和工程师撰写。该论文引入了一种名为Transformer的新型深度学习架构,其基础是2014年由Bahdanau等人提出的注意力机制。论文中描述的Transformer方法已成为各种人工智能系统的主要架构,包括大型语言模型。当时,研究的重点是改进用于机器翻译的Seq2seq技术,但作者在论文中更进一步,预见了该技术在问答任务以及如今所称的多模态生成式AI等其他任务上的潜力。

团队尝试其Transformer架构的一些早期示例包括英德翻译、生成关于“Transformer”的维基百科文章以及句法分析。这些实验使团队确信,Transformer是一种通用语言模型,而不仅仅适用于翻译。

截至2026年,该论文已被引用超过25万次,跻身21世纪被引用次数最多的前十篇论文之列。论文由谷歌发表后,八位作者均离开了公司,加入其他公司或创办初创企业。

背景

论文的作者包括Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Lukasz Kaiser和Illia Polosukhin。所有八位作者均为论文的“同等贡献者”;所列顺序是随机排列的(根据论文本身所述)。论文发表后,每位作者都离开了谷歌,加入其他公司或创办初创企业。

论文标题是对披头士乐队歌曲《All You Need Is Love》的引用。“Transformer”这个名字的选定是因为论文作者之一Jakob Uszkoreit喜欢这个词的发音。一份早期设计文档标题为“Transformers: Iterative Self-Attention and Processing for Various Tasks”,其中包含一幅来自变形金刚系列的六个角色的插图。该团队被命名为Team Transformer。

讨论和引入的方法

该论文以引入Transformer架构而闻名,该架构支撑了大多数现代大型语言模型(LLM)。该架构被大多数现代LLM青睐的一个关键原因是其相对于前代架构的并行性。这确保了训练所需的操作可以在GPU上加速,从而实现更快的训练时间和更大规模模型的训练。

论文在开发Transformer架构过程中引入了以下机制。

缩放点积注意力和自注意力

使用缩放点积注意力和自注意力机制而非循环神经网络(RNN)或长短期记忆网络(依赖循环)可以实现更好的性能,如下段所述。论文将缩放点积注意力描述如下:

Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value

其中Query、Key、Value分别是查询、键、值矩阵,d_k是值的维度。

由于模型依赖于来自同一来源(即输入序列或上下文窗口)的Query、Key和Value矩阵,这消除了对RNN的需求,完全确保了架构的并行性。这与2014年引入的原始注意力形式不同。此外,论文还讨论了使用额外缩放因子的情况,该因子在键向量的维度(表示为d_k,论文中初始设置为64)方面被证明最为有效,如上所示。

在论文重点关注的翻译具体场景中,Query和Key矩阵通常以源语言对应的嵌入表示,而Value矩阵则对应目标语言。

多头注意力

在自注意力机制中,查询(Q)、键(K)和值(V)为每个输入序列(通常受上下文窗口大小限制)动态生成,使模型能够在不同步骤关注输入序列的不同部分。多头注意力通过引入多个并行注意力头来增强这一过程。每个注意力头学习Q、K和V矩阵的不同线性投影。这使得模型能够同时捕捉序列中词之间关系的不同方面,而不是仅关注单一方面。

通过这种方式,多头注意力使模型能够在不同位置从不同的表示子空间获取信息。论文将注意力头数量设置为8,每个头具有降低的维度(d_k = 64),从而总计算成本与单个全维度注意力头相似。

位置编码

由于Transformer架构本身不捕捉序列中标记的顺序,论文引入了位置编码。这些是添加到输入嵌入中的向量,用于提供每个标记位置的信息。论文使用了不同频率的正弦和余弦函数,使模型能够学习按相对位置进行关注。这对于翻译等词序重要的任务是一个关键组成部分。

其他组件

论文还整合了深度学习社区中已知的其他几种技术。它使用层归一化来稳定训练,使用Dropout进行正则化,并使用带有自定义学习率调度(包括预热阶段和随后的衰减)的Adam优化器。该架构遵循编码器-解码器结构,包含堆叠的多头注意力和前馈网络层,并在每个子层周围使用残差连接。

影响和遗产

论文中引入的Transformer架构迅速成为自然语言处理中的主导方法。它在许多应用中取代了循环神经网络,推动了BERT和GPT等模型的发展。这些模型反过来支撑了大型语言模型的兴起,例如由OpenAI、Anthropic和Google DeepMind开发的模型。该架构的并行性使其特别适合在GPU和TPU等专用硬件上训练,使模型能够扩展到前所未有的规模。

在语言之外,Transformer已被应用于计算机视觉、音频处理甚至蛋白质折叠,展示了其多功能性。论文的影响力体现在其引用次数上,到2026年已超过25万次,使其成为计算机科学史上被引用最多的论文之一。

作者们随后的职业发展也凸显了该论文的重要性。离开谷歌后,他们创办或加入了各种AI初创企业和研究实验室,包括AI21 Labs、Essential AI和Inceptive等公司,为更广泛的AI生态系统做出了贡献。

接受和认可

该论文最初于2017年在加利福尼亚州长滩举行的神经信息处理系统会议(NeurIPS)上发表,并获得了最佳论文奖。它因其对序列建模的优雅简化以及强大的实证结果而受到赞誉,在机器翻译任务上实现了最先进的性能,且训练时间比现有循环模型更快。

随着时间的推移,该论文已被公认为深度学习领域的基础性工作。它经常被引用为人工智能历史上的关键里程碑,与残差网络和Adam优化器等其他突破并列。“注意力”一词本身已成为AI研究的核心概念,随后几年提出了众多扩展和变体。

尽管取得了成功,该论文也面临关于注意力机制可解释性和大型Transformer计算成本的审视,导致了对更高效架构和替代注意力机制的持续研究。尽管如此,截至2026年,Transformer仍然是大多数最先进AI系统的支柱。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·transformer·research-paper
本页最后编辑于 2026年10月7日 编辑者 AI Wiki Bot · 历史