译自英文

ARC(AI2推理挑战)是一个基准数据集,包含小学科学问题,分为简单集和挑战集,用于评估人工智能系统的推理能力。

AI2推理挑战(ARC)是一个基准数据集,旨在评估人工智能系统的推理能力。该数据集由艾伦人工智能研究所(AI2)创建,包含小学标准化考试水平的科学选择题。数据集分为两个子集:简单集和挑战集,其中挑战集包含对现有AI模型而言特别难以正确回答的问题。ARC已成为人工智能领域中衡量机器理解和推理进展的标准参考点。

ARC于2018年由AI2的一个研究团队引入,团队成员包括Peter Clark、Isaac Cowhey、Oren Etzioni、Tushar Khot、Ashish Sabharwal、Carissa Schoenick和Oyvind Tafjord。该基准旨在解决早期数据集的局限性,这些数据集往往允许模型利用统计线索而非真正的推理。问题来源于小学科学考试,涵盖物理、化学、生物学和地球科学等主题。每个问题包含四个答案选项,数据集中提供了正确答案,用于训练和评估目的。

挑战集是该基准的主要焦点。它包含的问题无法通过简单的检索或模式匹配轻松回答,需要更深入的推理和对科学概念的理解。在原始论文中,作者报告称,基于变换器架构的强神经模型在挑战集上的准确率仅为约53%,而在简单集上则超过80%。这一差距凸显了挑战集的难度,并推动了后续在机器学习深度学习方面的研究。

数据集组成与构建

ARC共包含7,787个科学问题,其中简单集有4,787个,挑战集有3,000个。问题来源于公开的小学科学考试,包括纽约州会考和其他标准化考试。数据集包含问题文本、四个答案选项以及正确答案。问题设计为无需外部知识即可回答,仅需小学和初中科学课程中通常教授的内容。

构建过程涉及筛选那些可以通过简单词语匹配或检索回答的问题,这些被分配到简单集。其余需要更复杂推理的问题则构成挑战集。作者还为一些问题提供了一组“支持事实”,即提供相关背景知识的简短陈述,但这些事实并不总是足以正确回答问题。

评估与影响

ARC已被广泛用作评估AI系统的基准,特别是在问答和推理领域。它通常与SQuAD和GLUE等其他基准一起使用,以评估大型语言模型的能力。挑战集已被证明是一个严峻的考验:即使是最先进的模型,包括基于神经网络架构和变换器的模型,也难以超越人类表现,后者估计约为90%的准确率。截至2024年,挑战集上表现最佳的系统已达到接近90%的准确率,但该基准仍是一个活跃的研究领域。

ARC还影响了机器学习中新技术的发展,例如课程学习和利用数据增强来改进推理。该基准已被用于评估主要AI研究组织的模型,包括OpenAIAnthropicGoogle DeepMind,并已成为生成式AI系统开发中的关键指标。

局限性与批评

尽管ARC广受欢迎,但它也面临批评。一些研究人员认为,该数据集过于狭窄,仅关注小学科学,可能无法推广到其他领域。其他人则指出,挑战集可能被利用答案选项中的统计规律性的模型“钻空子”,尽管数据集的设计旨在尽量减少此类捷径。此外,为某些问题提供的支持事实并不总是完整的,这可能使评估模型是真正推理还是仅仅记忆模式变得困难。

另一个局限性是,ARC不需要多步推理或整合问题文本之外的外部知识,这限制了其衡量更高级推理能力的能力。因此,一些研究人员提出了更具挑战性的基准,例如MMLU(大规模多任务语言理解)数据集,它涵盖了更广泛的学科和难度级别。

未来方向

ARC仍然是AI研究社区的宝贵工具,并可能继续作为评估新模型和技术的基线。未来的工作可能涉及扩展数据集以包含更多样化的问题类型,或纳入答案解释以更好地评估推理。该基准也提醒人们人类与机器推理之间的差距,激励着人工智能领域持续努力缩小这一差距。

总之,ARC是AI研究中的基础基准,为推理能力提供了具有挑战性的测试。其简单集和挑战集提供了对模型性能的细致观察,其影响延伸到该领域新算法和架构的开发。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·reasoning·question-answering·artificial-intelligence
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史