Transformer是一族用于深度学习的人工神经网络架构,基于多头注意力机制。文本、图像或音频等输入数据被转换为称为token的数值表示序列,每个token通过词嵌入表映射为一个向量。在每一层中,每个token都在上下文窗口内通过并行多头注意力进行语境化,放大重要token并削弱不太相关的token。由于自注意力本身具有置换不变性,Transformer通过位置编码或学习到的嵌入注入位置信息,从而使token顺序影响输出。
Transformer没有循环单元,训练时间比早期的循环架构(如LSTM)更短。现代设计分为仅编码器、仅解码器和编码器-解码器变体,分别针对表示学习、自回归生成或条件序列到序列任务进行优化。原始Transformer由Google的研究人员在2017年论文《Attention Is All You Need》中提出。此后,它成为大型语言模型(LLM)的基础,并在自然语言处理、计算机视觉、强化学习、音频、多模态学习、机器人和国际象棋等领域得到应用。
历史
前身
多年来,序列建模使用普通循环神经网络(RNN),如Elman网络(1990年)。理论上,一个token的信息可以传播任意远,但梯度消失问题使得长序列难以提取精确信息。一个关键突破是LSTM,在1995年的技术报告中描述并于1997年正式发表,它引入了门控机制来缓解梯度消失。LSTM使用乘法门控单元,在概念上不同于加性注意力。它成为直到2017年的长序列建模标准,但RNN按顺序处理token,阻碍了并行化。线性扩展的快速权重控制器(1992年)学习根据输入计算权重矩阵,等价于未归一化的线性Transformer。
带注意力的seq2seq
编码器-解码器序列转换在2010年代初发展起来,有两篇2014年的同期论文。一个380M参数模型使用两个LSTM进行机器翻译:编码器LSTM将token序列转换为向量,解码器LSTM将其转换为输出。另一个130M参数模型使用门控循环单元(GRU),后来证明与LSTM相当。这些早期seq2seq模型缺乏注意力,依赖最后一个词后的固定大小状态向量,难以保留长输入信息。反转输入句子改善了翻译效果,凸显了瓶颈。RNN搜索模型将注意力引入seq2seq,更好地处理了长依赖。2016年,Google Translate被改造为Google Neural Machine Translation,使用8层双向LSTM seq2seq模型,性能优于统计方法。
并行化注意力
带注意力的seq2seq模型仍受循环网络并行化困难的影响,限制了GPU加速。2016年,可分解注意力将自注意力应用于前馈网络,以更少的参数实现了最先进的文本蕴含性能。作者Jakob Uszkoreit怀疑无注意力的循环机制可能足以用于翻译,这导致了《Attention Is All You Need》的标题。
架构
Transformer架构由编码器和解码器组成,每层包含多头自注意力和位置前馈网络。编码器并行处理输入序列,而解码器自回归生成输出,使用掩码自注意力防止未来token泄漏。多头注意力并行运行多个注意力机制,使模型能够关注不同的表示子空间。位置编码被添加到token嵌入中以捕获顺序。层归一化和残差连接稳定训练。解码器还使用交叉注意力来关注编码器输出。
变体
仅编码器
仅编码器模型(如BERT)针对表示学习进行优化,生成上下文相关的token嵌入,适用于分类和理解任务。它们使用双向注意力,同时看到左右上下文。
仅解码器
仅解码器模型(如GPT)专为自回归生成设计,根据先前token预测下一个token。它们使用掩码自注意力,是大多数现代LLM的基础,在大型文本语料库上训练。
编码器-解码器
编码器-解码器模型(如原始Transformer)处理条件序列到序列任务,如翻译和摘要。编码器处理源序列,解码器生成目标序列。
应用
Transformer用于生成式AI系统,包括GPT和BERT等LLM,已被OpenAI、Anthropic和Google DeepMind等公司采用。它们驱动自然语言处理、计算机视觉(视觉Transformer)、强化学习、音频处理、多模态学习、机器人甚至国际象棋程序。其可扩展性推动了硬件进步,出现了AWS Trainium和Groq推理处理器等专用芯片。
影响
Transformer彻底改变了人工智能,使得预训练系统能够针对各种任务进行微调。它们相比RNN减少了训练时间,并允许前所未有的模型规模,带来了语言理解和生成方面的突破。该架构的灵活性使其成为许多AI应用的默认选择,影响了研究和工业界。
局限性与未来
尽管取得了成功,Transformer在上下文长度上需要二次方计算,使得长序列成本高昂。研究人员正在探索线性注意力机制和替代架构来解决这一问题。截至2025年,Transformer仍占主导地位,但持续创新可能会带来更高效的设计。