涌现能力,在大型语言模型的语境中,指的是当模型跨越参数、训练数据或计算量的某个规模阈值后,突然出现的能力,而非像整体训练损失在缩放定律下那样平滑且可预测地提升。当某个能力在较小模型中表现接近随机水平,而在同一系列的较大模型中跃升至显著高于随机水平的表现,且较小模型的得分中没有任何即将改进的明确信号时,该能力就被描述为涌现的。
术语起源
这一概念在2022年一篇被广泛引用的论文《大型语言模型的涌现能力》中被正式化,作者为Jason Wei及其合著者。该论文调查了多个模型系列的基准测试结果,识别出数十项任务,包括某些算术问题、一些多步推理任务以及指令遵循行为,在这些任务中,较小模型的表现接近随机猜测,而一旦模型达到特定规模,表现则急剧上升。论文将此模式与少样本学习和上下文学习等技术联系起来,其中模型利用提示中给出的示例而非通过额外训练来执行任务的能力,似乎依赖于跨越能力阈值。思维链提示,即要求模型在回答前逐步推理,被引用为一种其益处似乎仅在足够大的模型中显现的技术,在较小模型中提供很少或没有益处,有时甚至损害性能。
“幻象”批评
2023年,研究人员Rylan Schaeffer、Brando Miranda和Sanmi Koyejo发表了一篇题为《大型语言模型的涌现能力是幻象吗?》的论文,认为许多声称的涌现能力是研究者选择的度量标准造成的假象,而非底层模型的真实属性。他们表明,在相同任务和相同模型输出上,从严格的、全有或全无的准确率度量(将答案完全评对或完全评错)切换到更平滑的部分信用度量,往往会将看似急剧的性能跃升转变为与缩放定律紧密吻合的渐进、连续改进。在这种观点下,底层能力一直在平滑改进,只有不连续的评分规则的选择使改进看起来像突然涌现。
持续争论
这一争议尚未完全解决。原始框架的支持者指出,某些能力确实似乎需要一定规模的阈值才能出现,而且在不同规模模型上处理实际任务的经验(不仅仅是基准测试)通常显示出模型可靠完成任务的定性差异,而非增量差异。怀疑者回应说,举证责任应在于证明在本身并非构造上不连续的度量下存在突然转变,而且许多最引人注目的声称跃升在更严格的统计审查下并未成立。这一争论超越学术兴趣,因为它关系到未来能力增益的可预测性:如果能力可能在尚未达到的规模上突然且不可预测地出现,这将使预测更强大系统相关风险的努力复杂化,这一关切将涌现能力与关于通用人工智能和人工智能存在风险的更广泛讨论联系起来。