《注意力就是你所需要的一切》是一篇2017年的研究论文,主题为机器学习,由八位在谷歌工作的科学家和工程师撰写。该论文引入了一种新的深度学习架构,称为变换器,基于2014年Bahdanau等人提出的注意力机制。变换器方法已成为多种人工智能系统的主要架构,包括大型语言模型。当时,研究重点是改进用于机器翻译的序列到序列技术,但作者预见了该技术在其他任务上的潜力,如问答和现在所谓的多模态生成式人工智能。
变换器架构的早期实验包括英语到德语的翻译、生成关于“变换器”的维基百科文章以及句法分析。这些测试使团队确信,变换器是一种通用语言模型,而不仅仅用于翻译。截至2026年,该论文已被引用超过25万次,位列21世纪被引用最多的论文前十名。论文发表后,八位作者均离开了谷歌,加入其他公司或创办初创企业。
背景
作者包括Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Lukasz Kaiser和Illia Polosukhin。八人贡献均等,所列顺序为随机排列。标题引用了披头士乐队的歌曲《你所需要的一切就是爱》。“变换器”这一名称的选定是因为Jakob Uszkoreit喜欢这个词的发音。早期设计文档标题为《变换器:各种任务的迭代自注意力与处理》,并包含一幅来自《变形金刚》系列的六个角色的插图。团队名为“变换器团队”。
引入的方法
该论文最著名的是引入了变换器架构,该架构构成了大多数现代大型语言模型的基础。其受青睐的一个关键原因是该架构相对于前代架构具有并行性,能够在GPU上进行训练,从而缩短训练时间并支持更大的模型。论文引入了多种机制。
缩放点积注意力与自注意力
论文将缩放点积注意力描述为:注意力(查询,键,值) = softmax(查询 × 键^T / sqrt(d_k)) × 值,其中查询、键和值为矩阵,d_k为键的维度(初始设为64)。使用自注意力替代循环神经网络(RNN)或长短期记忆网络(LSTM)消除了循环性,确保了并行性。在翻译中,查询和键矩阵通常对应源语言嵌入,而值则对应目标语言。
多头注意力
在自注意力中,查询、键和值针对每个输入序列动态生成,使模型能够关注不同部分。多头注意力引入了多个并行注意力头,每个头学习Q、K和V的不同线性投影。这使得模型能够同时捕捉词关系的不同方面。
位置编码
由于变换器没有循环性,论文引入了位置编码,以注入序列中标记位置的信息。这些编码被添加到输入嵌入中,使模型能够利用顺序信息。
影响与遗产
变换器架构已成为大多数现代大型语言模型的基础,包括由OpenAI、Anthropic和谷歌深度思维开发的模型。其并行性和可扩展性推动了生成式人工智能及其他领域的进步。该论文的影响力体现在其引用数量上,使其成为21世纪被引用最多的论文之一。
后续发展
论文发表后,八位作者均离开了谷歌。一些人创办了初创企业,如Aidan Gomez(Cohere)和Noam Shazeer(Character.AI,后返回谷歌)。其他人则加入了英伟达或英特尔等公司。他们的离开促进了基于变换器的研究在整个行业的传播。