ScienceQA是一个大规模基准数据集,旨在评估人工智能系统回答科学问题的能力。它于2022年由加州大学洛杉矶分校的研究团队及其他机构引入。该数据集包含超过21,000道多项选择题,涵盖物理、化学、生物学和地球科学等学科,每道题都附有图像或图表以及上下文信息。ScienceQA以其多模态特性而著称,要求模型整合文本和视觉理解才能得出正确答案。
该基准的创建是为了解决早期问答数据集的局限性,这些数据集通常只关注纯文本或纯图像任务。ScienceQA提供了一个更现实且更具挑战性的场景,因为科学问题通常涉及解读图表、图示和实验设置。这些问题来源于中小学科学课程,使其对广泛的AI模型具有可访问性,同时仍需要真正的推理能力。每道题都标注了多项选择选项、正确答案和人类可读的解释,从而能够评估和分析模型的推理过程。
数据集结构与标注
ScienceQA包含21,208道题,分为训练集、验证集和测试集。训练集包含12,726道题,验证集有4,241道题,测试集包含4,241道题。每道题都与一个学科、主题、年级和类别(例如“自然科学”或“社会科学”)相关联。标注还包括提供背景信息的文本上下文,以及相关的图表或图像。正确答案由人类标注者撰写的简明解释提供,该解释作为评估模型生成解释质量的参考。
该数据集涵盖广泛的科学主题,包括物理(例如力、能量)、化学(例如化学反应、物质状态)、生物学(例如植物和动物细胞、生态系统)以及地球科学(例如天气、地质过程)。这些题目旨在测试不仅是事实记忆,还包括推理能力,例如将概念应用于新情境、从图表中解读数据以及从视觉表征中进行推断。
评估与基线模型
ScienceQA在引入时附带了一系列使用各种机器学习模型的基线实验。作者评估了多种方法,包括传统的视觉-语言模型和更新的基于Transformer的架构。其中一个关键发现是,许多现有模型在ScienceQA上表现不佳,测试集上的准确率通常低于50%,这突显了该基准的难度。当时表现最佳的基线使用了一种多模态Transformer,将图像特征与文本嵌入相结合,在测试集上达到了约89%的准确率,但仍低于估计超过90%的人类表现。
此后,该基准已成为多模态推理和问答研究的标准评估工具。它已被用于评估大型语言模型和视觉-语言模型的能力,包括由OpenAI和Google DeepMind等组织开发的模型。例如,GPT-4和Gemini等模型已在ScienceQA上进行了测试,其中一些达到了90%以上的准确率,展示了AI推理方面的显著进展。
在AI研究中的作用
ScienceQA在推动人工智能多个领域的研究中发挥了关键作用。它已被用于研究思维链提示的有效性,即鼓励模型在提供答案之前生成中间推理步骤。研究表明,此类提示技术可以提高ScienceQA上的表现,尤其对大型语言模型而言。该数据集还被用于调查视觉和文本信息的整合,从而推动了更好地对齐图像和语言表示的新架构的开发。
此外,ScienceQA已被用于探索AI中的可解释性概念。由于每道题都包含人类撰写的解释,研究人员可以将模型生成的解释与这些参考进行比较,以评估模型如何为其答案提供依据。这对构建可信赖的AI系统具有重要意义,因为提供连贯解释的能力对于教育和科学研究中的应用至关重要。
局限性与未来方向
尽管有其优势,ScienceQA仍存在某些局限性。这些题目基于学校水平的课程,可能无法捕捉高级科学推理的复杂性。此外,多项选择格式有时可能允许模型在没有深入理解的情况下正确猜测,尽管解释有助于缓解这一问题。该数据集也是静态的,意味着它不反映近期的科学发现或课程变化。
未来的工作可能涉及扩展ScienceQA以包含更多开放式问题,涵盖更高层次的主题,并纳入交互式模拟等动态元素。研究人员还在探索将ScienceQA用作持续学习的基准,其中模型必须随时间适应新类型的问题。随着AI系统的不断改进,像ScienceQA这样的基准将继续在衡量进展和识别需要进一步研究的领域方面发挥重要作用。