译自英文

ARC-Challenge是AI2推理挑战(ARC)的一个高难度子集,该基准测试用于问答任务,要求进行深度推理,于2018年推出,旨在测试AI系统超越简单模式匹配的能力。

ARC-Challenge是AI2推理挑战(ARC)的一个子集,这是一个由艾伦人工智能研究所(AI2)于2018年推出的问答基准数据集。ARC数据集包含小学水平的多项选择科学问题,取材于标准化考试和课程材料。挑战集经过专门筛选,仅包含对基于检索和共现的算法而言难度较大的问题,使其成为检验AI系统执行多步推理、常识推断和科学知识应用能力的严格测试。

完整的ARC数据集分为两个部分:简单集和挑战集。挑战集通常被称为ARC-Challenge,包含约2,590个问题,而简单集包含约5,190个问题。这种划分是通过评估简单统计和检索模型在每个问题上的表现来实现的;那些难倒此类模型的问题被归入挑战集。这一设计确保在ARC-Challenge上取得高分不能通过记忆模式或依赖表面词汇线索来实现,从而推动该领域朝着更强大的推理能力发展。

历史背景与动机

ARC-Challenge的创建源于对许多现有问答基准趋于饱和的观察,即模型通过利用数据集偏差达到了接近人类的表现。由Peter Clark和Oren Etzioni等研究人员领导的AI2团队旨在提供一个在未来数年仍具相关性的基准,并鼓励开发真正理解科学概念的系统。ARC-Challenge中的问题不仅需要事实回忆,还需要结合多个事实、应用逻辑规则以及推理日常现象的能力。例如,一个问题可能询问为什么在相同温度下金属勺子比木勺感觉更冷,这需要理解热导率和热传递。

基准特征与评估

ARC-Challenge问题为多项选择,每个问题有四个答案选项,涵盖地球科学、生物学、物理学和化学等主题。这些问题设计为受过良好教育的初中生即可回答,但往往涉及细微差别,需要仔细阅读。评估通常以准确率(正确回答问题的百分比)来报告。自发布以来,ARC-Challenge已成为Artificial intelligence社区的标准基准,与Winograd Schema Challenge和OpenBookQA数据集等其他推理测试一起使用。该基准公开可用,并已被研究论文广泛采用,排行榜跟踪各种模型的进展。

现代AI系统的表现

最初,2018年的最先进模型在ARC-Challenge上达到了约30-40%的准确率,仅略高于25%的随机猜测基线。大规模Transformer (architecture)模型的出现,特别是Large language model,带来了显著改进。例如,由OpenAI于2020年推出的GPT-3等模型在挑战集上达到了约55-60%的准确率。更近期的系统,如GPT-4和Claude 3,报告准确率超过90%,通常接近或超过人类在该基准上的表现。然而,研究人员警告说,ARC-Challenge上的高分并不一定意味着稳健的推理,因为模型可能仍依赖记忆的训练数据或启发式方法。该基准仍然是衡量进展的有用工具,但通常辅以更具对抗性和动态性的评估。

局限性与批评

对ARC-Challenge的主要批评是,它可能不再对最新一代AI模型构成足够难度,导致“饱和效应”,即改进不再具有意义。此外,由于问题源自公开教育材料,它们可能已被纳入许多大型模型的训练语料库,引发了对数据污染的担忧。为解决这些问题,研究人员提出了变体和扩展,例如带有对抗性扰动的ARC-Challenge或相关的ARC-DA(领域适应)任务。尽管存在这些局限性,ARC-Challenge仍作为评估推理能力的宝贵基线,其设计原则影响了MMLU和BIG-bench等新基准的创建。

相关基准与未来方向

ARC-Challenge的成功启发了系列推理基准。同样来自AI2的OpenBookQA数据集侧重于使用少量核心事实进行开卷推理。CommonsenseQA基准测试常识知识,而RiddleSense数据集针对谜语和横向思维。在Machine learningDeep learning的背景下,ARC-Challenge通常与这些基准结合使用,以全面评估模型的推理能力。未来工作可能涉及创建自动生成和更新的动态基准以防止饱和,以及需要多模态推理的基准,即将文本与图像或图表结合,这是当前AI评估的前沿领域。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·question-answering·reasoning·ai-evaluation
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史