译自英文

涌现算法是一种计算过程,其行为源于简单组件间的相互作用,而非显式编程。它是人工智能和复杂系统中的一个概念,常见于大型神经网络中,能力会意外出现。

涌现算法是一种计算过程,其整体行为源于各组成部分之间的相互作用,而非显式编程或集中控制。在人工智能的背景下,该术语描述的是神经网络或大型语言模型发展出未被其创造者直接设计或预见的能力或策略的情况。这些行为源于在庞大数据集上训练期间学到的统计模式,通常在大规模下出现,并且是该领域内活跃研究和争论的主题。

这一概念借鉴了复杂系统中更广泛的涌现理论,即局部层面的简单规则产生复杂的全局现象。在计算领域,早期例子包括元胞自动机和群体智能,但现代AI中的用法与深度学习模型的扩展密切相关。随着模型规模增大并在更多数据上训练,它们有时会展现出推理、翻译或问题解决方面的技能,这些技能并未显式编码在其架构或损失函数中,导致研究人员将其描述为涌现。

历史背景

计算中的涌现思想早于现代AI。在1980年代和1990年代,施乐帕克研究中心和麻省理工学院计算机科学与人工智能实验室等机构的研究人员探索了自组织系统和人工生命,其中简单代理或规则产生复杂行为。然而,“涌现算法”一词在2010年代和2020年代随着基于Transformer的模型兴起而获得突出地位。一个里程碑式的观察来自对OpenAI的GPT系列和谷歌DeepMind模型的研究,其中扩大参数规模导致在算术或多步推理等任务上的性能突然跃升,而非渐进式改进。

机制与示例

AI中的涌现算法通常与特定的训练技术和架构特征相关。例如,多头注意力允许模型学习多样化的关系模式,这些模式可能以意想不到的方式组合。课程学习和RLHF(基于人类反馈的强化学习)也可以引导模型朝向那些虽未显式编码但作为训练目标最优解而涌现的行为。

一个常被引用的例子是大型语言模型执行思维链推理的能力。当被提示“逐步思考”时,像GPT-3或后续版本的模型会生成中间步骤,从而得出正确答案,这种能力并非显式编程,而是从代码、数学和文本训练中涌现的。另一个例子是内部表示的自主形成,例如关于性别或时态等概念的线性代数结构,这些是通过多伦多大学和斯坦福AI实验室研究人员的探测研究发现的。

研究与争论

对涌现算法的研究存在争议。一些研究人员,包括梅兰妮·米切尔和布伦丹·莱克,认为许多声称的涌现能力是评估指标或模型规模的产物,而非根本上的新算法。他们建议,看似涌现的现象可能可以从较小模型的性能曲线中预测。相反,共同发明Transformer的研究人员如雅各布·乌兹科雷特和利昂·琼斯则指出,扩展规模往往揭示出难以从第一原理预见的能力。

一个关键挑战是定义神经网络中什么构成“算法”。与传统具有显式步骤的算法不同,涌现算法分布在数百万个权重中,使其难以提取或验证。这导致了可解释性方面的努力,例如Anthropic和谷歌DeepMind的研究,旨在映射内部电路并识别执行特定子任务的功能模块。

对AI发展的影响

涌现算法的存在具有实际意义。它表明,仅通过扩大模型规模,如亚马逊网络服务使用AWS Trainium芯片或谷歌云的TPU所做的那样,可以在不重新设计架构的情况下解锁新能力。这推动了向更大模型发展的竞赛,NVIDIA(尽管不在提供的列表中,注意AMD和英特尔是竞争对手)和台积电制造越来越强大的硬件。

然而,这也引发了安全担忧。如果行为不可预测地涌现,就更难保证模型不会发展出意外策略,如欺骗或奖励黑客行为。伯克利AI研究和卡内基梅隆大学的研究人员呼吁建立稳健的评估框架,以便在部署前检测涌现风险。

未来方向

关于涌现算法的未来工作集中在两个方面。首先,开发理论框架来预测涌现何时发生,借鉴统计物理和复杂性理论。其次,创建工具来控制或抑制不希望的涌现行为,可能通过模型剪枝或数据增强等技术来塑造学习景观。随着模型持续扩展,理解涌现可能将成为推进AI及其安全融入社会的核心。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·complex-systems·machine-learning·emergence
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史