译自英文

SciQ是一个包含13,679道带答案解释的科学选择题考试题目的数据集,用于评估和提升人工智能系统(尤其是大型语言模型)的推理能力。

SciQ是一个包含13,679道多项选择科学问题的数据集,旨在用于人工智能系统的训练和评估。每个问题都附有正确答案和支持性解释,使其成为机器阅读理解与科学推理研究中的宝贵资源。该数据集由艾伦人工智能研究所的研究人员创建,并于2017年发布,此后已成为人工智能研究领域的标准基准。

SciQ中的问题取材于初中和高中科学课程,涵盖物理、化学、生物学和地球科学等主题。该数据集通过从在线教育资源中挖掘问题,然后进行筛选和清理以确保质量的方式构建而成。每个答案所提供的解释通常为一到两句话,简洁地说明了所选选项正确的理由。这一特点使SciQ区别于许多其他问答数据集,后者通常仅提供正确答案而不附带任何论证。

构建与组成

SciQ数据集是通过自动化和人工流程相结合的方式构建的。初始问题池收集自公开的科学考试题库和教育网站。研究人员随后应用一系列过滤器来移除格式错误或含糊不清的问题,最终得到13,679个项目。每个问题有四个答案选项,其中恰好有一个正确选项。数据集被划分为训练集(11,679个问题)、验证集(1,000个问题)和测试集(1,000个问题),从而能够在不同模型之间进行一致的评估。

SciQ的一个显著特点是,每个问题都包含解释,即使是训练集中的问题也不例外。这种设计选择使得该数据集可用于超越简单答案预测的任务,例如解释生成和多任务学习。这些解释通常简短且基于事实,提供了解决问题所需的关键科学原理。

在人工智能研究中的应用

SciQ已被广泛用作评估机器学习模型推理能力的基准,特别是在深度学习神经网络的背景下。早期在SciQ上测试的模型包括记忆增强网络和基于注意力的架构,与人类表现相比,这些模型取得了适中的准确率。该数据集也被用于训练和评估大型语言模型,随着模型规模和复杂性的增长,其性能已显示出显著提升。

SciQ带来的关键挑战之一是,它要求模型不仅要检索事实知识,还要应用逻辑推理在干扰项中选择正确答案。解释为训练模型生成理由提供了有用的信号,这可以提高人工智能系统的可解释性和可信度。研究人员还利用SciQ来研究训练数据规模、模型架构和微调策略对问答性能的影响。

局限性与批评

尽管SciQ广受欢迎,但它存在若干局限性。这些问题相对简单,侧重于事实回忆,而非复杂的多步推理。因此,最先进的模型已在测试集上达到近乎完美的准确率,导致一些研究人员认为该基准已趋于饱和。此外,该数据集仅限于英语,且覆盖的科学主题范围较窄,可能无法推广到其他领域或语言。

另一个批评是,这些解释虽然有用,但并不总是足以让模型学习到稳健的推理能力。有些问题可以通过匹配问题和答案选项的语言模式来正确回答,而无需深入理解基础科学。这促使了更具挑战性的基准的开发,例如需要多跳推理或整合外部知识的基准。

相关数据集与基准

SciQ是人工智能社区中更广泛的问答数据集家族的一部分。它常与其他科学类数据集进行比较,如ARC(AI2推理挑战),后者包含需要更复杂推理的更难问题。虽然ARC旨在更具挑战性,但SciQ因其更大的规模和解说的存在而受到重视。其他相关基准包括OpenBookQA,它测试关于科学的常识性知识,以及QASC,它侧重于结合多个句子中的事实。

SciQ的可用性促进了生成式人工智能系统的发展,这些系统能够回答问题并提供解释。它也被应用于教育技术领域,例如通过提供逐步解决方案来帮助学生学习科学的自动辅导系统。

影响与遗产

自发布以来,SciQ已被数百篇研究论文引用,并已成为自然语言处理社区中评估人工智能模型的标准工具。其简单的格式和清晰的评估协议使其对计算资源有限的研究人员具有可及性。该数据集也被整合到几个更大的基准中,如SuperGLUE和MMLU,这些基准聚合多个任务以提供对模型能力的更全面评估。

SciQ的成功激发了在其他领域创建类似数据集,例如医学和法律,这些领域中解释同样重要。它还凸显了在训练数据中包含人类可读论证的价值,这一做法已被许多现代人工智能系统所采用。截至2025年,SciQ仍然是教育目的和新模型初步评估的有用资源,尽管更具挑战性的基准仍在不断涌现。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·question-answering·science·benchmark
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史