ARC-AGI,即人工通用智能抽象与推理语料库,是由Keras深度学习框架的创建者François Chollet于2019年首次发布的一个基准测试。它由视觉网格谜题组成,求解者必须从少量示例输入-输出网格对中推断出一个抽象的变换规则,然后将该规则正确应用于新的测试网格。
目的
ARC-AGI的设计明确是为了回应一个观察:许多AI基准测试,无论多么困难,都可以通过大规模模式匹配或记忆来大幅解决,而非真正的推理或泛化。Chollet在随附论文《论智能的度量》中主张,智能应通过在新任务上的技能获取效率来衡量,而非在任一固定、可学习技能上的原始表现。他设计的ARC-AGI谜题每个都需要一种独特的、可泛化的抽象,借鉴人类早期获得的概念,如对称性、计数、包含关系和物体恒存性,并特意选择那些难以通过记忆模式来走捷径的谜题。
对AI系统的难度
在发布后的多年里,ARC-AGI被证明对经典机器学习和早期的大型语言模型都具有显著抵抗力,即使是能力较强的GPT-4级模型也只能解决公开评估集中的一小部分谜题,而大多数人类,包括儿童,无需特殊训练即可解决大部分谜题。这种在MMLU等常规基准测试上表现强劲,而在ARC-AGI上表现疲弱的差距,经常被引为证据,表明仅靠规模扩展,而不具备质的不同推理能力,不足以实现类人的泛化。
推理模型的进展
随着使用扩展测试时计算和思维链式搜索的推理模型的出现,这一差距显著缩小,最著名的是OpenAI的o1及其后继模型,它们在ARC-AGI上的得分远高于先前的非推理模型,尽管每个谜题的推理成本往往显著更高。一些人将这一进展视为证据,表明推理时的搜索和深思,而非仅靠预训练规模,是通向更通用推理的一条有意义路径,而另一些人则警告说,这些收益部分反映了模型从公开排行榜数据中学习了类似ARC-AGI的谜题模式,而非完全通用的推理改进。
格式与奖金
ARC-AGI谜题有意保持部分私密,设有一个未公开的保留评估集,专门用于限制训练数据污染问题,这一问题削弱了早期静态基准测试的有效性。一个相关的公开竞赛“ARC奖”为在保留集上取得强劲表现的系统提供现金奖励,吸引了学术界和工业界的参与者,并定期发布更难的后续版本,包括ARC-AGI-2,因为早期版本已接近饱和。
意义
ARC-AGI经常在关于AGI时间线以及当前深度学习方法是否足以实现通用智能的辩论中被提及,恰恰因为其设计目标,,抵抗记忆化同时保持对人类易解,,使其成为一个罕见的基准测试,在能力强大的大型语言模型时代,人类与AI表现之间的巨大差距仍持续存在。它仍然是衡量真正推理进展的最受关注的指标之一,区别于那些更易受规模和纯数据影响的基准测试。