Transformer是一种神经网络架构,于2017年提出,它通过注意力机制处理文本等序列数据,而非早期模型采用的逐步循环方式,从而能够并行处理整个序列。它已成为几乎所有现代大型语言模型的基础,并已被适配用于图像、音频及其他数据类型。
历史
在Transformer之前,机器翻译等任务的序列建模主要依赖循环神经网络,包括Seq2seq编码器-解码器模型,这些模型逐个处理输入标记,因此难以并行化,也难以在长序列中保留信息。Transformer在2017年的论文《注意力即你所需要》中提出,作者团队包括阿希什·瓦斯瓦尼和诺姆·沙泽尔,他们主张完全摒弃循环,转而采用自注意力机制。该论文的全部八位作者随后都离开了完成这项工作的公司,转而创办或加入其他AI公司,这对于单一研究论文而言是不同寻常的结果。
架构
Transformer处理输入序列时,首先通过分词和嵌入将其转换为向量表示,然后反复应用自注意力层,使序列中的每个位置都能权衡其他所有位置的相关性,同时配合简单的前馈层。由于自注意力本身不具备序列顺序的概念,Transformer会向其输入表示中添加位置信息。并行运行的多个注意力“头”使模型能够同时捕捉不同类型的关系。原始架构使用独立的编码器和解码器;大多数现代大型语言模型采用仅解码器变体,该变体基于所有先前生成的标记逐个生成文本。
影响
Transformer的并行化能力使得模型能够在远大于循环架构所允许的数据集和参数规模上进行训练,直接推动了从2018年的BERT到GPT-3及以后模型的规模驱动进步。其自注意力机制原则上适用于任何可以表示为序列的数据,也被适配用于图像,催生了视觉Transformer,并用于现代视觉语言模型中结合文本和图像的系统。
变体与替代方案
自注意力的计算成本随序列长度呈二次方增长,这促使了注重效率的变体以及完全不同的架构的出现。混合专家模型对于任何给定输入仅激活Transformer参数的一个子集,从而在模型规模相对固定的情况下降低计算成本。状态空间模型,例如2023年引入的Mamba架构,提供了一种替代方案,其计算成本随序列长度线性增长而非二次方增长,尽管截至2020年代中期,它们尚未取代Transformer成为前沿语言模型的主导架构。