译自英文

自回归模型一次生成一个序列元素,根据已生成的令牌预测每个新令牌;它是支撑GPT风格大型语言模型的生成机制。

自回归模型是一种生成模型,它一次生成一个序列元素,每个新元素都基于之前生成的所有内容进行条件化。在自然语言处理中,这意味着根据已生成的令牌序列预测下一个令牌,然后将该令牌反馈回去以预测后续令牌。该术语源于统计学,其中自回归模型根据时间序列自身的过去值来预测其值;现代大型语言模型将相同的从左到右分解应用于文本。

自回归生成是大多数基于大型语言模型的现代聊天助手背后的默认解码策略,从OpenAI的GPT系列到Anthropic的Claude和Meta的Llama。它并非生成序列的唯一方式,但截至2025年,它仍然是文本生成的主导范式,其变体也用于音频、代码,甚至某些图像模型。

历史

统计自回归模型可追溯到20世纪20年代关于时间序列的研究,远早于计算技术的存在。在语言建模中,20世纪80年代和90年代的n-gram模型在精神上是自回归的,通过使用计数概率从固定窗口的前序单词预测一个单词。神经自回归语言模型随着循环神经网络以及后来的LSTM网络而出现,这些网络逐步处理序列并在每一步预测下一个单词。该范式在很大程度上原封不动地延续到了Transformer架构中:GPT-2及其后继者是仅解码器的Transformer,训练目标是预测下一个令牌,这一目标有时被称为因果语言建模。

工作原理

在训练期间,自回归模型被展示一个文本语料库,并在每个位置被要求根据所有先前的令牌预测后续令牌,这种方法被称为自监督学习,因为标签来自文本本身而非人工标注。模型的损失函数通常是预测的下一个令牌分布与实际下一个令牌之间的交叉熵。在推理时,采样策略(如贪婪解码、top-k或核采样)决定如何从模型预测的概率分布中选择下一个令牌,所选令牌被附加到上下文中以进行下一次预测,此过程重复进行,直到达到序列结束令牌或长度限制。

自回归与其他方法对比

自回归模型与非自回归和基于扩散的方法形成对比。扩散模型用于大多数图像和视频生成,它一次性生成整个输出并通过去除噪声迭代细化,而不是逐元素生成。一些研究系统探索了用于加速的非自回归文本生成,到2020年代中期,少数实验室尝试了基于扩散的文本模型,但截至2025年,没有一种方法取代自回归解码成为语言处理的主流方法。状态空间模型(如Mamba)在预测顺序的意义上也是自回归的,但用不同的计算结构取代了Transformer的注意力机制。

局限性

自回归生成本质上是顺序的:每个令牌依赖于前一个令牌,这限制了推理时的并行性,而训练时所有位置可以同时计算(使用教师强制)。这一顺序瓶颈催生了诸如推测解码等技术,该技术使用一个较小的草稿模型提出多个令牌,由较大的模型并行验证。自回归模型还可能累积小错误:生成早期的一个不太可能或错误的令牌会成为后续每个令牌上下文的一部分,这种动态与幻觉以及超长生成中输出质量下降有关。

影响

自回归的下一令牌预测目标在现代AI的故事中占据核心地位:它简单、不需要标注数据,并且随数据和计算量可预测地扩展,这一关系在缩放定律中得到了研究。其简单性部分解释了为何单一训练目标能产生能够进行翻译、编码和推理的模型,而无需任务特定的架构,这种通用性后来在基础模型的概念中得到了正式化。

分类:deep-learning·natural-language-processing·model-architecture
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史