译自英文

ARC-Easy是抽象与推理语料库(ARC)的一个简化子集,旨在评估人工智能系统在模式识别和类比推理等核心认知能力上的表现,其任务难度低于完整基准。

ARC-Easy是抽象推理语料库(ARC)的一个精选子集,该基准由François Chollet于2019年提出,旨在通过抽象推理任务衡量机器智能。完整的ARC包含数千个独特问题,其中AI必须从少量输入-输出网格示例中推断变换规则,并将其应用于新的测试网格。ARC-Easy选取了其中被认为更易处理的一部分问题,通常涉及更简单的网格尺寸、更少的颜色或更直接的变换,使其成为研究人员测试新人工智能模型时的常见起点。

ARC-Easy中的任务设计为人类只需极少指导即可解决,但对许多机器学习系统而言仍具挑战性,因为它们需要超越统计模式的泛化能力。每个问题提供少量输入-输出对(通常为2-3个)作为演示,求解者必须推断出底层规则,该规则可能涉及对象操作、对称性、计数或空间推理。与依赖大型数据集的深度学习基准不同,ARC-Easy强调少样本学习和抽象推理,推动模型发展组合性和因果性理解,而非记忆。

与完整ARC基准的关系

ARC-Easy并非独立语料库,而是原始ARC数据集的过滤版本。完整ARC包含800个训练任务和800个评估任务,每个任务分为训练集(用于演示)和测试集(用于评估)。ARC-Easy通常包含这些任务中经人工或算法识别为较易的子集,往往是网格较小(如3x3或5x5)且颜色种类较少的问题。这使得研究人员在攻克完整基准之前,能够对模型架构进行调试和迭代,而完整基准包含更复杂的任务,需要多步推理和抽象概念形成。

易与难的区分在原始ARC论文中并未正式定义,但社区努力已根据人类解决率或计算复杂性对任务进行了分类。例如,涉及简单旋转、反射或颜色交换的任务通常被归类为易,而需要递归模式或对象交互的任务则更难。因此,ARC-Easy作为评估神经网络设计增量进展的实用工具,尤其适用于旨在超越训练分布进行泛化的模型。

评估与评分

在ARC-Easy中,与完整ARC一样,模型根据其正确预测测试输入输出网格的能力进行评估。每个任务的评分为二元的:只有当预测网格与预期输出完全匹配(包括所有单元格值)时,解决方案才算正确。这一严格标准意味着部分解决方案不会获得任何分数,强调了精确规则推断的必要性。截至2024年,ARC-Easy上最先进模型的典型成功率仍低于50%,而人类在相同任务上能达到近乎完美的准确率,凸显了当前大型语言模型方法与人类推理之间的差距。

近期若干工作尝试使用Transformer架构解决ARC-Easy,有时结合程序合成或神经符号方法。例如,一些研究人员使用序列到序列模型将网格表示转换为符号程序,而另一些则采用数据增强技术增加训练数据。然而,这些方法往往过度拟合特定任务类型,并在新问题上失败,凸显了实现真正抽象的难度。

挑战与局限

ARC-Easy的一个主要挑战是“易”标签具有主观性,可能无法与模型性能相关联。一些人类认为琐碎的任务(如复制模式)可能因网格的离散性和缺乏自然语言监督而对模型造成困难。相反,人类认为中等难度的任务可能因搜索空间较小而被模型通过暴力搜索解决。这种不匹配使得ARC-Easy作为衡量人工智能进展的可靠基准变得复杂。

另一个局限是数据集规模较小。由于易子集中仅有几百个任务,模型如果在开发期间访问训练集,很容易记忆解决方案,导致分数虚高。为缓解这一问题,研究人员通常在不公开的保留任务上进行评估,但这降低了可复现性。ARC社区已提议使用隐藏测试集,但ARC-Easy因其可访问性而常用于内部开发。

应用与未来方向

ARC-Easy常用于学术研究中测试新型架构和学习范式。例如,麻省理工学院计算机科学与人工智能实验室斯坦福人工智能实验室的研究人员已使用它探索课程学习策略,即模型在逐渐更难的任务上训练。它也是生成式AI系统的基准,这些系统旨在不依赖大规模预训练的情况下推理视觉模式。像OpenAIGoogle DeepMind这样的公司已发布关于ARC的结果,尽管它们通常关注完整基准而非易子集。

未来工作可能涉及将ARC-Easy与强化学习或结合深度学习与显式规则推理的神经符号方法集成。截至2025年,尚无模型在ARC-Easy上达到人类水平的表现,表明抽象和推理中的根本挑战仍未解决。该基准继续激发对少样本学习元学习的研究,希望易任务上的突破能转化为更难任务上的进展。

参见

  • 抽象推理语料库(完整基准)
  • 少样本学习
  • 神经符号AI
  • 通用人工智能
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·benchmark·reasoning·machine-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史