ARC-Easy是AI2推理挑战(ARC)的一个基准子集,该数据集包含小学水平的科学选择题。它由艾伦人工智能研究所(AI2)于2018年推出。ARC数据集分为挑战集和简易集;ARC-Easy包含由基于检索的算法正确回答的问题,因此其难度低于挑战集。ARC-Easy被广泛用于评估人工智能系统(包括大型语言模型)的推理和知识能力。
AI2推理挑战旨在解决现有问答基准的局限性,这些基准往往依赖于简单的模式匹配。该数据集包含7,787道真实的小学科学问题,其中训练集有3,787道,开发集有1,196道,测试集有2,804道。简易集包含其中可由简单信息检索系统正确回答的问题子集,而挑战集则由该系统无法回答的问题组成。这一区分使研究人员能够衡量在直接任务和更复杂推理任务上的进展。
构成与特征
ARC-Easy的问题与完整ARC数据集来源相同,均来自3至9年级的科学考试。每道题为四选一的多项选择题,并提供了正确答案。问题涵盖物理科学、生命科学以及地球与空间科学等主题。由于简易集是根据基线算法的表现选出的,它往往包含更直接可从文本知识回答的问题,对多步推理或常识推断的需求较少。
简易集比挑战集更小;例如,ARC-Easy的测试集包含2,376道题,而挑战集为1,172道。开发集有570道题,训练集有2,251道题。这种分布使ARC-Easy成为快速评估的便捷基准,因为它提供了更多样本以实现统计显著性,同时仍呈现有意义的推理挑战。
在AI研究中的应用
ARC-Easy已成为人工智能和机器学习领域的标准基准。它经常用于评估大型语言模型(LLM)及其他问答系统的性能。例如,GPT-3及后续版本等模型已在ARC-Easy上进行了测试,以衡量其科学推理能力。该基准也包含在更广泛的评估套件中,如Open LLM排行榜,作为评估模型能力的多项任务之一。
研究人员通常会将ARC-Easy的准确率与更具挑战性的ARC-Challenge一并报告。虽然最先进的模型在ARC-Easy上取得了高分,但挑战集仍然更难,凸显了简单检索与深度推理之间的差距。ARC-Easy也用于神经网络、Transformer和深度学习架构的研究,因为它提供了一个受控环境来测试知识整合和推理能力。
与其他基准的关系
ARC-Easy属于一个推理基准家族,包括ARC-Challenge、CommonsenseQA和OpenBookQA。这些基准旨在测试AI推理的不同方面,从事实回忆到常识推断。ARC-Easy通常与ARC-Challenge配对使用,以提供难度谱系;简易集适用于调试和快速迭代,而挑战集则推动当前模型的极限。
该基准也用于评估训练数据和模型规模的影响。例如,研究表明,较大的模型往往在ARC-Easy上表现更好,但在挑战集上的提升则较难预测。这引发了关于AI推理本质以及记忆与泛化作用的讨论。
局限与批评
尽管ARC-Easy广受欢迎,但它存在局限性。问题源自小学考试,可能无法捕捉现实世界科学推理的复杂性。此外,由于简易集是根据基线算法的表现定义的,它可能无法完美校准人类难度。一些批评者认为,在ARC-Easy上取得高分可以通过浅层模式匹配实现,该基准并未充分测试深层理解。然而,它仍然是追踪AI研究进展的有用工具。