因果语言建模

译自英文

因果语言建模是一种神经网络训练目标,它仅根据前一个token预测下一个token,构成了GPT等自回归大型语言模型的基础。它使用从左到右的注意力掩码,确保预测仅依赖于过去的上下文。

因果语言建模是一种用于机器学习深度学习的训练目标,其中模型仅根据序列中前面的词元来预测下一个词元。这种自回归方法,也称为从左到右或单向语言建模,构成了许多现代大型语言模型的基础,包括由OpenAI开发的GPT系列。与BERT等模型中使用的掩码语言建模不同,因果语言建模将注意力限制在过去的上下文上,从而能够一次一个词元地高效生成连贯文本。

该目标通常在Transformer架构中通过应用因果注意力掩码来实现,该掩码防止每个位置关注未来位置。在训练期间,模型被呈现词元序列,并学习最大化每个词元在给定所有先前词元条件下的概率。这种简单而强大的公式使模型能够从大量文本数据中学习语言的统计规律,包括句法、语义和世界知识。

历史发展

因果语言建模的根源可追溯到20世纪70年代发展起来的统计方法。IBM Research的Frederick Jelinek及其同事引入了用于语音识别的概率n-gram模型,该模型根据固定窗口的先前单词预测下一个单词。这些模型使用困惑度作为模型不确定性的信息论度量,这一指标至今仍在使用。

在2000年代,Yoshua Bengio及其合著者引入了神经概率语言模型,该模型学习分布式词表示,超越了稀疏的n-gram计数。随后是循环神经网络(RNN)语言模型,尤其是Tomáš Mikolov在2010年推进的工作,该模型通过维护隐藏状态理论上可以捕获任意长的依赖关系。然而,RNN存在梯度消失和并行化受限的问题,限制了其可扩展性。

Transformer架构在2017年由Google和多伦多大学的研究人员发表的论文《Attention Is All You Need》中引入,提供了突破。Transformer使用自注意力并行处理整个序列,当与因果掩码结合时,它们能够高效训练深度自回归模型。该架构成为现代因果语言模型的骨干。

技术基础

因果语言建模对分词文本进行操作,其中单词或子词映射到整数索引。模型为每个位置计算词汇表上的概率分布,给定前面的词元。训练损失通常是预测分布与实际下一个词元之间的交叉熵,在训练语料库的所有位置上取平均。

因果注意力掩码是关键组件。在Transformer解码器中,每个位置可以关注到包括自身在内的所有位置,但不能关注未来位置。这是通过将未来位置的注意力分数设置为负无穷大,然后应用softmax来实现的。这种掩码确保模型尊重时间因果性,使其适用于未来词元未知的生成任务。

嵌入起着至关重要的作用,因为它们将离散词元映射到连续向量。这些学习到的表示捕获语义和句法相似性,使模型能够泛化到未见过的单词组合。位置编码被添加到嵌入中,以提供词元顺序的信息,因为自注意力是排列不变的。

训练与扩展

因果语言模型在大量文本语料库上训练,通常从公共互联网抓取。训练过程涉及最小化训练数据的负对数似然,通常使用带有自适应优化器(如Adam)的随机梯度下降。训练计算密集,需要专用硬件,如NVIDIA GPU或定制加速器,如AWS Trainium

由Jared Kaplan和Dario Amodei等研究人员研究的扩展定律表明,模型性能随模型大小、数据集大小和计算量的增加而可预测地提高。这推动了越来越大模型的发展,从具有15亿参数的GPT-2到具有1750亿参数的GPT-3,以及后来超过一万亿参数的模型。训练此类模型需要跨数千个加速器的分布式计算,通常使用Microsoft AzureGoogle CloudOracle Cloud提供的集群。

数据质量和整理至关重要。模型通常在过滤后的网页文本、书籍和学术文章上训练。一些模型采用课程学习,其中训练数据按难度递增的顺序呈现。最终训练语料库通常包括去重和质量过滤,以去除低质量或有害内容。

应用与用例

因果语言模型驱动广泛的自然语言处理应用。最突出的是文本生成,其中模型生成连贯的段落、文章、代码或创意写作。这种能力支撑了聊天机器人和虚拟助手,例如由AnthropicInflection AI开发的系统。

除了生成之外,因果语言模型还用于:

  • 机器翻译,其中模型根据源文本生成目标语言文本
  • 摘要生成,其中长文档被压缩为较短的摘要
  • 问答系统,其中模型根据上下文和查询生成答案
  • 代码生成,如GitHub Copilot等模型所展示的
  • 语音识别,其中声学特征被转换为文本序列

这些模型还作为特定任务微调的基础。通过用预训练的因果语言模型初始化并在任务特定数据上训练,开发人员可以用相对较少的示例实现高性能,这一过程称为迁移学习。

与其他架构的比较

因果语言建模与BERT等模型中使用的掩码语言建模有根本不同。掩码模型在双向上下文中预测随机掩码的词元,这更适合分类和命名实体识别等理解任务。相比之下,因果模型针对生成进行了优化,并且只能通过额外微调用于理解任务。

编码器-解码器模型,如T5,结合了双向编码和自回归解码。这些模型通常更适合序列到序列任务,如翻译和摘要,其中整个输入在生成开始前可用。然而,纯因果模型在许多任务上表现出竞争性能,并提供更简单的架构。

循环神经网络虽然在历史上很重要,但在因果语言建模中已在很大程度上被Transformer取代。Transformer在训练期间提供更好的并行化,并可以通过注意力机制捕获更长范围的依赖关系。然而,RNN在具有严格内存约束或流式要求的某些应用中仍然相关。

评估与基准

因果语言模型使用各种测试不同能力的基准进行评估。困惑度仍然是基本的内部指标,衡量模型预测保留文本的能力。较低的困惑度表示更好的预测性能,尽管它并不总是与任务成功相关。

外部评估使用任务特定的基准,包括:

  • 大规模多任务语言理解(MMLU),测试57个学科的知识
  • HellaSwag,评估常识推理
  • GSM8K,衡量数学推理
  • BIG-bench,覆盖多样任务的协作基准
  • Winograd Schema Challenge,测试代词消解

这些基准通常在少样本或零样本设置中进行,其中模型被给予示例或指令并必须产生答案。人工评估也用于开放式生成任务,其中评估有用性和无害性等指标。

局限性与挑战

尽管具有令人印象深刻的能力,因果语言模型仍有显著局限性。它们可能产生事实不正确的信息,这种现象称为幻觉。它们也可能表现出训练数据中存在的偏见,包括性别、种族和文化刻板印象。这些问题引发了对它们在高风险应用中部署的担忧。

计算成本巨大。训练大型因果语言模型需要数百万美元的计算和能源,引发环境问题。推理也需要大量资源,尽管量化和蒸馏等技术有助于降低成本。

因果模型本质上是统计模式匹配器,而不是人类语言理解的认知模型。研究表明,它们有时学习人类不学习的模式,并且未能学习人类通常学习的模式。这限制了它们推理新情况或理解世界中因果关系的能力。

未来方向

因果语言建模的研究持续发展。稀疏注意力机制,如GPT-3等模型中使用的,降低了计算复杂度。混合专家架构,如Switch Transformer中采用的,在不按比例增加计算的情况下增加模型容量。

高效训练方法,包括参数高效微调和低秩适应,使大型模型更容易适应特定任务。检索增强生成将因果语言模型与外部知识库相结合,以提高事实准确性。多模态扩展,如GPT-4,将图像和音频理解与文本相结合。

来自CerebrasGroqSambaNova等公司的硬件创新正在推动训练和推理速度的边界。随着模型继续扩展,研究人员正在探索提高样本效率、减少幻觉以及使模型与人类价值观对齐的方法。该领域仍然活跃,新的架构和训练技术不断涌现。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·natural-language-processing·deep-learning·language-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史