OpenBookQA是一个于2018年提出的问答基准,用于评估机器利用显式科学事实和隐式常识进行多步推理的能力。该基准由艾伦人工智能研究所(AI2)的研究团队创建,成员包括Todor Mihaylov、Peter Clark、Tushar Khot和Ashish Sabharwal。它包含5,957道小学科学水平的选择题,每道题配有一组来自“开放书籍”的核心科学事实,该书籍包含1,326条基础科学事实。任务要求模型从四个选项中选出正确答案,但关键在于,所提供的事实本身并不充分,模型必须将其与更广泛的世界知识和逻辑推理相结合,才能得出正确答案。
该基准旨在解决早期问答数据集的局限性,这些数据集往往允许模型通过浅层模式匹配或记忆来取得成功。在OpenBookQA中,问题的设计使得正确答案不会直接出现在所提供的事实中,从而迫使系统推理这些事实如何应用于问题。这使得该基准成为对推理能力更严格的测试,并已成为人工智能和机器学习领域的标准评估工具。
设计与结构
OpenBookQA包含5,957道题,分为训练集(4,957道)、开发集(500道)和测试集(500道)。每道题是一个有四个选项的选择题。该基准包含一本由1,326条科学事实组成的“开放书籍”,这些事实是简短的陈述句,例如“植物需要阳光制造食物”或“水在100摄氏度时沸腾”。这些事实摘自小学科学教科书,涵盖生物学、物理学和化学等主题。
问题的设计使得具备基础科学知识的人类可以轻松回答,但需要将给定事实与常识相结合。例如,一个问题可能问:“如果将植物放在黑暗的房间里,以下哪种情况最可能发生?”所提供的事实可能说明“植物需要光照才能生长”,但正确答案需要推断出植物将无法良好生长,而这并未明确陈述。这种设计迫使模型超越简单的检索,进行推理。
该基准还包括一组“众包”问题,这些经过人工标注者验证,以确保其无歧义且非专家也能回答。创建者使用多阶段流程生成和筛选问题,以确保高质量和难度。
评估与性能
OpenBookQA已成为评估大型语言模型和其他AI系统的广泛使用的基准。早期模型,包括基于Transformer架构的模型,表现不佳,准确率通常低于60%,而人类表现约为92%。这一差距凸显了将显式知识与隐式推理相结合的挑战。
随着时间的推移,随着深度学习的进步和更大模型的发展,性能显著提高。到2021年,GPT-3等模型在该基准上的准确率约为80%,到2023年,包括OpenAI和Google DeepMind在内的最先进系统已接近或超过90%的准确率。这些改进得益于模型规模的扩大、更好的训练数据以及思维链提示等技术,后者鼓励模型逐步推理。
尽管取得了这些进展,OpenBookQA仍然是一个具有挑战性的基准,因为它测试的推理不易通过简单模式匹配来捕捉。即使模型获得高分,研究人员也指出,它们可能仍依赖统计规律而非真正的理解,这使得该基准成为探索当前AI系统极限的有用工具。
影响与遗产
OpenBookQA影响了后续基准的设计,如ARC(AI2推理挑战)和CommonsenseQA,这些基准同样强调推理而非检索。它还推动了知识增强模型的研究,这些模型结合外部知识库或检索机制来改进推理。该基准常与其他评估结合使用,以评估模型的通用智能,并出现在斯坦福AI实验室和伯克利AI研究等组织的排行榜上。
该基准对开放书籍推理的关注也促进了关于AI中记忆与理解之间区别的讨论。它已被数百篇研究论文引用,并成为许多模型评估套件的标准组成部分,包括亚马逊网络服务和谷歌云在其AI服务中使用的套件。
局限性与批评
一些研究人员批评OpenBookQA过于狭窄,因为它专注于小学科学,可能无法推广到更复杂的推理任务。其他人指出,该基准的多项选择格式可能被利用答案选项统计偏差的模型所利用,例如选择最长答案或与问题重叠最多的答案。为缓解这一问题,创建者引入了“部分学分”评分方案,但并未完全解决这些担忧。
此外,该基准依赖固定的事实集,意味着在大型语料库上训练的模型可能已经见过类似问题或事实,导致潜在的数据污染。这促使一些研究人员呼吁采用更动态的基准,随时间更新以避免饱和。
尽管存在这些局限性,OpenBookQA仍然是评估推理能力的宝贵工具,并在推进神经网络和生成式AI系统研究方面发挥了关键作用。其设计原则已为更全面基准的开发提供了参考,这些基准旨在捕捉更广泛的认知技能。