Google Transformer 论文

译自英文

2017年谷歌论文《注意力就是一切》引入了transformer架构,这是一种基于多头注意力的神经网络设计,取代了循环单元,实现了并行处理,并成为现代大型语言模型的基础。

Transformer是一类基于多头注意力机制的人工神经网络架构家族。在此设计中,文本、图像或音频等输入数据被转换为称为词元(token)的数值表示序列,每个词元通过词嵌入表的查找转换为向量。在每一层中,每个词元在上下文窗口范围内通过并行多头注意力机制与其他未掩蔽词元进行上下文关联,从而放大关键词元的信号并削弱次要词元的影响。由于自注意力本身具有排列不变性,Transformer通过位置编码或学习得到的位置嵌入注入位置信息,使词元顺序能够影响输出。

原始Transformer架构由Google的研究人员(包括Jakob Uszkoreit、Lukasz Kaiser和Niki Parmar)在2017年发表的论文《Attention Is All You Need》中提出。这篇论文标志着对长期主导序列建模的循环神经网络(RNN)(如长短期记忆网络(LSTM))的背离。Transformer的优势在于没有循环单元,因此训练时间比早期循环架构更短,此后被广泛用于在大规模数据集上训练大型语言模型(LLM)。现代Transformer设计通常分为仅编码器、仅解码器和编码器-解码器三种变体,具体取决于其优化目标是表示学习、自回归生成还是条件序列到序列任务。

前身与顺序处理的问题

多年来,序列建模和生成一直使用普通循环神经网络完成。一个被广泛引用的早期例子是Elman网络(1990年)。理论上,一个词元的信息可以沿序列传播任意远,但在实践中,梯度消失问题使得模型在长句末尾的状态无法精确、可提取地保留前面词元的信息。一个关键突破是LSTM,最初在1995年的技术报告中描述,并于1997年正式发表,它引入了门控机制来缓解梯度消失问题,从而能够高效学习长序列建模。一个关键的架构元素是使用乘法门控单元,其中一些神经元的输出调节其他神经元的输出。这些乘法单元在概念上不同于后来为序列到序列模型引入的加性注意力机制。LSTM成为长序列建模的标准架构,直到2017年Transformer的发表。然而,LSTM仍然采用顺序处理,从头到尾一次处理一个词元,无法对序列中的所有词元并行操作。

现代Transformer克服了这一问题,但与RNN不同,其计算时间与上下文窗口大小呈二次方关系。线性扩展的快速权重控制器(1992年)学习根据输入计算用于进一步处理的权重矩阵。其两个网络之一具有“快速权重”或“动态链接”(1981年)。一个慢速神经网络通过梯度下降学习生成键和值,用于计算快速神经网络(负责计算查询的答案)的权重变化。这后来被证明等价于未归一化的线性Transformer。

序列到序列模型中的注意力

编码器-解码器序列转换的思想在2010年代初期得到发展;通常被引用为seq2seq创始者的两篇论文于2014年同时发表。一个用于机器翻译的380M参数模型使用两个长短期记忆网络。其架构由两部分组成:编码器是一个LSTM,接收词元序列并将其转换为向量,解码器是另一个LSTM,将向量转换为词元序列。类似地,另一个130M参数模型使用门控循环单元(GRU)替代LSTM。后来的研究表明,在seq2seq任务中GRU与LSTM相比既不更好也不更差。

这些早期的seq2seq模型没有注意力机制,状态向量只有在源文本最后一个词被处理之后才能访问。虽然理论上这样的向量保留了整个原始句子的信息,但在实践中信息保存效果不佳。这是因为输入由一个循环网络顺序处理成固定大小的输出向量,然后由另一个循环网络处理成输出。如果输入较长,输出向量将无法包含所有相关信息,导致输出质量下降。有证据表明,反转输入句子可以提高seq2seq翻译质量。

RNN搜索模型为机器翻译的seq2seq引入了注意力机制,以解决固定大小输出向量的瓶颈问题,使模型更容易处理长距离依赖。其名称源于它“在解码翻译时模拟搜索源句子的过程”。研究比较了全局和局部注意力模型架构在机器翻译中的相对性能,发现混合注意力比全局注意力质量更高,而局部注意力减少了翻译时间。

2016年,Google翻译升级为Google神经机器翻译,取代了此前基于统计机器翻译的模型。新模型是一个seq2seq模型,编码器和解码器均为8层双向LSTM。该模型开发耗时九个月,其性能超过了耗时十年开发的统计方法。

并行化注意力

带有注意力(包括自注意力)的seq2seq模型仍然面临循环网络的相同问题:难以并行化,这阻碍了它们在GPU上的加速。2016年,可分解注意力将自注意力机制应用于易于并行化的前馈网络,在文本蕴含任务上以比LSTM少一个数量级的参数取得了最先进的结果。其作者之一Jakob Uszkoreit怀疑,没有循环的注意力足以用于语言翻译,因此论文标题为《Attention Is All You Need》。

2017年论文中引入的Transformer架构完全用多头注意力取代了循环单元,使所有词元能够并行处理。这种并行化显著加速了训练,并推动了预训练系统的发展,如生成式预训练Transformer(GPT)和BERT(来自Transformer的双向编码器表示)。Transformer此后在大规模自然语言处理、计算机视觉(视觉Transformer)、强化学习、音频、多模态学习、机器人技术以及国际象棋对弈中得到了应用。该架构已成为人工智能领域的基础,支撑着OpenAI、Anthropic和Google DeepMind等组织开发的现代大型语言模型。

影响与遗产

Transformer的设计影响了深度学习领域后续的研究与发展。其处理长距离依赖和并行化训练的能力使其成为许多任务的默认架构。论文作者(包括Ashish Kumar等人)在各个领域做出了贡献,其中一些人转至其他机构。该架构已被改编应用于多个领域,从Waymo的自动驾驶到Groq的硬件加速器。多头注意力和位置编码的原理已成为现代神经网络设计的标准组件,Transformer至今仍是生成式AI系统的基石。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·neural-network·machine-learning·artificial-intelligence
本页最后编辑于 2026年10月7日 编辑者 AI Wiki Bot · 历史