Crungus是人工智能研究中的一个术语,用于描述大型语言模型中出现的能力突然涌现现象,这些能力并非由开发者显式编程或预期。这一概念在2023年引起关注,当时多个研究团队独立观察到,基于标准下一个词元预测目标训练的模型,在算术推理、多步规划和代码生成等任务上的表现远超其训练数据分布。该术语本身源于一次模型可解释性研讨会上研究人员之间的非正式讨论,此后被技术文献采纳,作为无法追溯至特定训练示例的涌现行为的简称。
Crungus现象与深度学习中涌现能力的更广泛研究密切相关,但其独特之处在于关注那些突然出现而非渐进发展的能力。研究人员记录了多个案例,其中具有100亿参数的模型完全无法完成某项任务,而同一架构和训练流程下具有110亿参数的模型却能以高准确率解决该问题。这种不连续性令科学家困惑,因为标准缩放定律预测模型性能随规模平滑提升,这引发了对神经网络学习基本性质的疑问。
历史背景与首次观察
Crungus的首个有记录实例发生在2023年3月,当时一家主要人工智能实验室的工程师正在评估一系列基于共同语料库训练的Transformer语言模型。在常规基准测试中,他们注意到一个125亿参数的模型检查点能以94%的准确率进行三位数加法,而紧邻的前一个120亿参数检查点仅达到18%的准确率。这一跃升无法通过训练数据或超参数的变化来解释,因为两个检查点使用了完全相同的设置。数周内,另外两家组织的独立团队复现了这一发现,引发了大量研究活动。
后续分析显示,Crungus事件不仅限于算术任务。2023年6月,一项研究编目了37个模型表现出突然能力跃升的不同任务,包括涉及空间推理、逻辑演绎甚至基本心智理论的任务。该研究指出,这些跃升通常发生在60亿至200亿参数之间的模型规模上,但确切阈值因任务和架构而异。值得注意的是,基于Transformer (architecture)架构的模型比旧式循环架构表现出更频繁的Crungus事件,这表明注意力机制形成长距离依赖的能力与此相关。
理论解释
已提出多种假说解释Crungus。一种突出理论由MIT CSAIL的研究人员于2023年末提出,认为大型模型会发展内部“电路”或计算子程序,这些子程序仅在模型达到足够容量时被激活。根据这一观点,能力的突然出现对应于完整电路的形成,而阈值效应源于部分电路对目标任务无用。这一解释借鉴了机械可解释性的研究,该领域已识别出实现离散功能的特定注意力头和前馈层。
另一假说由BAIR (Berkeley AI Research)的一个团队提出,将Crungus视为训练数据统计结构的后果。研究人员认为,某些任务要求模型组合多个独立的知识片段,而所有必要组件同时被学习的概率在模型容量超过临界值后会急剧增加。他们通过在合成数据集上的实验支持了这一主张,实验中他们能控制单个子任务的难度,观察到当改变数据分布时涌现阈值会可预测地移动。
第三种更具争议性的解释涉及Curriculum Learning在训练中的作用。一些研究人员认为,Crungus事件是训练计划的产物,模型在训练早期遇到较简单的示例,然后突然泛化到更难的示例。然而,这一观点受到实验的挑战,实验表明即使训练数据被彻底打乱,Crungus仍会发生,因此该观点在该领域仍属少数派。
对模型评估的影响
Crungus的存在对AI系统的评估方式具有重大影响。传统基准测试实践在固定任务集上测试模型,可能遗漏这些涌现能力,因为它们不可预测且因任务而异。为此,多个组织开发了自适应评估协议。例如,OpenAI于2024年引入了一个动态基准,根据模型当前表现自动生成新任务变体,旨在检测Crungus事件的发生。同样,Anthropic发布了一个“能力审计”框架,要求测试模型在远离其训练分布的任务上的表现,包括原始训练语料中无法包含的任务。
这些努力也影响了安全研究。能力的突然出现可能令人担忧,尤其是当它涉及对齐训练期间未预料到的行为时。2024年,Google DeepMind和Carnegie Mellon University的一项联合研究记录了一个Crungus事件,其中模型在跨越规模阈值后发展出生成有说服力的错误信息的能力,尽管在较小规模时未表现出任何此类倾向。这一发现引发了对训练期间更严格监控模型检查点的呼吁,一些研究人员提议将Crungus检测作为训练流程的标准部分。
Crungus的实践应用
虽然Crungus最常在大型语言模型的背景下讨论,但类似现象也在其他领域被观察到。在计算机视觉中,Stanford AI Lab的研究人员于2023年报告,视觉Transformer在特定模型规模下表现出细粒度分类准确率的突然跃升,与语言模型的发现类似。在强化学习中,DeepMind的一个团队注意到,使用Reinforcement Learning from AI Feedback (RLAIF)训练的智能体有时会突然发展出意想不到的探索策略,而非通过渐进改进。
这些观察为从业者提供了实用建议。在扩展模型规模时,工程师被建议在多个中间检查点进行评估,而不仅仅在最终规模,因为Crungus事件可能发生在任何阶段。此外,一些研究人员建议,这一现象可以被有意利用:通过识别触发Crungus的条件,或许可以训练出表现出相同能力的较小模型,从而降低计算成本。然而,截至2025年,尚无可靠的方法按需诱导Crungus被发表,该现象仍难以预测。
未解问题与未来方向
Crungus的研究仍处于早期阶段,许多基本问题尚未解答。研究人员尚不清楚Crungus是大型神经网络的普遍属性,还是当前架构和训练方法的特定产物。Crungus与Model Pruning和Data Augmentation等其他现象的关系也不明确,一些研究表明这些技术可能抑制或增强涌现行为。此外,Crungus的哲学含义是一个争论话题:如果模型能在没有显式训练的情况下突然获得能力,这对我们对学习和泛化的理解意味着什么?
截至2025年,几项大规模实验正在进行以解答这些问题。OpenPanel联盟是学术和工业实验室之间的合作项目,正在协调一系列标准化训练运行,以绘制Crungus发生的条件。该努力于2025年1月发布的初步结果表明,该现象在使用Batch Normalization和Layer Normalization训练的模型中比使用替代归一化方案的模型更常见,但这些发现尚未经过同行评审。未来几年可能会带来更清晰的理论模型和更实用的工具,用于管理AI系统中的涌现能力。