Next-Token预测

译自英文

下一词预测是自回归语言模型的核心训练目标,即模型根据序列中所有先前的词元来预测下一个词元,从而支持文本生成及其他自然语言任务。

下一个词元预测是自回归语言模型中使用的基本训练目标,尤其是在大型语言模型(LLM)中。在这种范式中,模型被训练为在给定序列中所有先前词元的条件下,估计下一个词元的概率,从而有效学习条件概率分布 P(词元_n | 词元_1, ..., 词元_{n-1})。该目标使模型能够通过迭代采样或选择最可能的下一个词元并将其附加到输入序列来生成文本。

这种方法对于基于Transformer (architecture)架构构建的现代大型语言模型至关重要,这些模型已取代了早期基于循环神经网络的模型以及诸如词n-gram语言模型之类的纯统计模型。通过在海量数据集(通常从公共互联网抓取)上进行训练,这些模型学会在各种任务中生成连贯且上下文相关的文本,包括自然语言生成、机器翻译和问答。

历史发展

下一个词元预测的概念根源可追溯到20世纪50年代,当时诺姆·乔姆斯基开发了使用形式语法描述语言的正式方法。然而,这些早期模型基于规则,不涉及概率预测。在20世纪70年代,弗雷德里克·杰利内克及其在IBM研究中心的同事将统计方法引入语言建模,作为语音识别工作的一部分。他们的团队使用词序列的概率n-gram模型,并引入困惑度作为模型不确定性的信息论度量。

1980年,第一个重要的统计语言模型被提出,并在该十年间,IBM进行了“香农式”实验,其中人类受试者预测或纠正文本,以识别语言建模的潜在改进。这些统计方法一直主导到2000年代神经方法的兴起。

统计基础

纯统计模型,尤其是基于词n-gram的模型,估计在给定前n-1个词的条件下某个词的概率。这些模型依赖于训练语料库中的计数,并遭受维数灾难,因为可能序列的数量随词汇量大小呈指数增长,导致数据稀疏。

指数语言模型,如最大熵模型,通过使用特征函数编码词与n-gram历史之间的关系来解决一些局限性。给定历史条件下词的概率计算为 P(w_m | w_1, ..., w_{m-1}) = 1/Z(w_1, ..., w_{m-1}) * exp(a^T f(w_1, ..., w_m)),其中Z是配分函数,a是参数向量,f是特征函数。这些模型通常需要正则化或参数先验。对数双线性模型是指数语言模型的另一个例子。

后来引入的跳元模型侧重于在给定中心词的条件下预测周围词,这与严格的下一个词元预测不同,但共享从上下文学习词分布的思想。

神经语言模型

神经语言模型在2000年代变得越来越重要。约舒亚·本吉奥及其合著者引入了一种概率神经网络语言模型,该模型在估计词序列概率的同时学习分布式词表示。这些连续空间嵌入通过将词表示为神经网络中权重的非线性组合,帮助缓解了维数灾难,避免了n-gram模型固有的数据稀疏问题。

循环神经网络(RNN)通过在处理序列时保留早期词的信息扩展了这种方法。2010年,托马什·米科洛夫及其同事证明,循环神经网络语言模型可以大幅优于传统n-gram模型。基于RNN的模型顺序处理序列,维护捕获上下文的隐藏状态,并基于该状态和当前输入预测下一个词元。

Transformer革命

Transformer (architecture)架构的引入标志着下一个词元预测的重大转变。Transformer依赖自注意力机制,允许模型同时权衡序列中所有先前词元的重要性,而不是顺序处理。这种并行化使得在更大数据集上的训练成为可能,并促成了大型语言模型的发展。

截至2026年,大型语言模型主要基于在更大数据集上训练的Transformer,通常使用从公共互联网抓取的文本。这些模型已取代基于循环神经网络的模型,后者此前已取代纯统计模型。诸如OpenAIAnthropicGoogle DeepMind等公司开发了使用下一个词元预测作为核心训练目标的著名LLM。

训练与生成过程

在训练期间,模型被呈现词元序列,并学习在给定前面词元的条件下预测每个词元。损失函数(通常是交叉熵)衡量预测概率与实际下一个词元之间的差异。通过反向传播和优化技术,模型调整其参数以最小化整个训练语料库上的损失。

在推理时,文本生成以自回归方式进行:模型接收初始提示,预测下一个词元,将其附加到提示中,并重复该过程。这会逐词元生成文本,每个新词元都基于所有先前生成的词元。词元的选择可以是确定性的(选择最高概率)或随机的(从概率分布中采样),其中温度缩放和top-k采样等技术影响输出多样性。

应用与影响

下一个词元预测支持文本生成之外的多种自然语言任务。这些包括语音识别、机器翻译、光学字符识别、手写识别、语法归纳、信息检索和灾难响应。预测自然语言序列的能力使语言模型可用于路线优化和其他基于序列的任务。

使用下一个词元预测训练的大型语言模型已展示出在摘要、代码生成和对话式AI等任务中的能力。然而,这些模型是否是人类语言处理的合理认知模型仍不清楚。至少对于循环神经网络,研究表明它们有时学习人类不学习的模式,但未能学习人类通常学习的模式。

评估与基准

语言模型的评估主要通过与源自典型语言导向任务的人类创建样本基准进行比较。其他不太成熟的质检测试检查模型的固有特征或比较两个模型。由于语言模型旨在动态学习数据,一些提出的模型通过检查学习曲线来研究学习率。

已开发出许多数据集用于评估语言处理系统。这些包括大规模多任务语言理解(MMLU)、语言可接受性语料库、GLUE基准、微软研究释义语料库、多体裁自然语言推理、问题自然语言推理、Quora问题对、文本蕴含识别、语义文本相似性基准、SQuAD问答测试、斯坦福情感树库、Winograd NLI、BoolQ、PIQA、SIQA、HellaSwag、WinoGrande、ARC、OpenBookQA、NaturalQuestions、TriviaQA、RACE、BIG-bench hard、GSM8k、RealToxicityPrompts、WinoGender和CrowS-Pairs。这些基准评估语言理解和生成的各个方面,提供标准化度量以比较模型性能。

未来方向

随着大型语言模型的持续发展,下一个词元预测仍然是一个基础目标,但研究人员正在探索变体和扩展。这些包括结合人类反馈强化学习的目标,以及提高效率和上下文处理的架构。专用硬件(如AWS TrainiumCerebras系统)的持续开发旨在支持大规模训练和部署这些模型的计算需求。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:language-modeling·machine-learning·natural-language-processing·deep-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史