译自英文

语言模型仅根据提示中提供的信息适应新任务,而无需更新其训练权重的现象。

上下文学习(in-context learning)是语言模型根据其提示内容来适应新任务的能力,这种适应完全基于提示本身,而无需对模型参数进行任何更新。用户可以在单次对话的上下文窗口内提供指令、示例或支持性文档,模型会基于这些材料来调整其后续输出,表现得仿佛它已经针对该任务进行过训练,尽管实际上并未发生任何训练过程。这一机制是少样本学习零样本学习提示方法的基础,也是现代基于Transformer大型语言模型中最具影响力的行为之一。

这一现象在2020年的GPT-3论文中被突出展示,该论文表明,一个足够大的预训练模型仅凭少量提示示例就能执行新任务,而无需进行任何梯度更新。由于这表面上看起来像是模型在单次前向传播中“学习”了,因此采用了“上下文学习”这一术语,以区别于传统的训练时学习(后者会改变模型权重),也区别于迁移学习微调(后者需要对特定任务数据进行显式的优化步骤)。

工作原理

关于上下文学习,目前尚无单一确定的机制解释,但存在几种被广泛引用的互补观点。一种观点将其视为一种隐式模式匹配:由于模型的预训练语料库中包含大量关于任务解释、演示和解答的文本示例,模型因此学会了一种通用的处理流程,能够针对“任务、示例、新实例”这样的序列,以符合隐含模式的方式继续生成输出。另一种更偏向机制层面的解释来自可解释性研究,该研究提出,Transformer内部的注意力机制可以实现某种类似简单学习算法的功能,实际上是在提示的各个词元之间进行一种轻量级的模式补全,甚至类似于梯度下降的计算过程。不过,这一解释仍是一个活跃且存在争议的研究领域,与更广泛的可解释性研究相关。此外,上下文学习还与模型规模带来的能力涌现密切相关,相关讨论见涌现能力,因为较小的模型往往从增加的上下文信息中获益较少,而足够大的模型则能显著受益。

应用

上下文学习是提示工程中大多数实际应用的基础,包括少样本演示、通过系统提示设定角色和身份,以及直接在提示中提供参考资料以便模型据此回答问题。这一模式还可扩展至检索增强生成,即参考资料是从外部来源动态获取而非手动粘贴。此外,上下文学习还支持在单次对话中进行快速的任务切换:聊天助手可以在编写代码、翻译段落和总结文档之间自如转换,这完全是因为每次新的指令都会重新调整模型的行为,而无需在轮次之间进行任何重新训练。

局限性与意义

上下文学习受限于上下文窗口的大小,并且当提示中的信息量变得非常庞大,或相关信息被埋没在长输入的中段时,其效果往往会下降,这种现象有时被非正式地描述为模型“丢失上下文”。此外,上下文学习不具备持久性:由于模型权重没有改变,任何在上下文中获得的信息都会在对话结束或上下文被清空后消失,这与微调形成对比,后者会对模型产生持久的改变。尽管存在这些局限,上下文学习仍被视为Transformer架构在实际部署中最重要的特性之一,因为它使得一个通用模型能够在推理时被灵活地重新用于几乎无限多样的任务,而无需承担重新训练或微调所需的成本、延迟或基础设施要求。

分类:nlp·llm-capabilities·emergent-behavior
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史