StrategyQA是一个问答基准测试,旨在评估人工智能系统,特别是大型语言模型的多跳推理能力。该数据集由艾伦人工智能研究所和华盛顿大学的研究人员于2021年推出,包含2,780个是非题,要求系统结合多条隐含知识来得出答案。与测试事实回忆的简单基准不同,StrategyQA的问题经过精心设计,要求进行策略性分解:模型必须将复杂问题拆分为更小、可回答的子问题,然后综合结果。
该基准的创建是为了弥补现有评估方法中的空白,这些方法通常侧重于单跳检索或浅层模式匹配。StrategyQA中的问题来源于维基百科和其他来源,但答案并未直接出现在任何单一段落中。例如,像“一台50英寸的电视能否放进2004年的Mini Cooper?”这样的问题,需要对两个物体的尺寸进行推理,这一步骤涉及隐含知识和多步推理。每个问题都附带一组“支持事实”,提供必要的背景信息,但模型必须正确识别并组合这些事实。
设计与构建
StrategyQA数据集通过一个多阶段过程构建,涉及自动化工作和人工努力。创建者首先从众包工作者那里收集了一组“策略问题”,要求他们提出需要多跳推理的问题。然后,标注者将这些问题分解为子问题,形成推理步骤图。最终数据集包含2,780个问题,每个问题平均有2.7个支持事实,黄金答案为“是”或“否”。问题涵盖广泛的主题,包括科学、历史、技术和日常生活,确保模型无法依赖特定领域的捷径。
StrategyQA的一个显著特点是其侧重于“隐含”推理。与HotpotQA等数据集不同,后者在多个段落中明确提供必要证据,StrategyQA要求模型利用自身的知识库。这使得该基准对于缺乏广泛世界知识或无法执行多步推理的模型尤其具有挑战性。数据集还包括一个包含489个问题的验证集和一个包含2,291个问题的测试集,测试集保持私有以防止过拟合。
评估与指标
StrategyQA的主要指标是是非答案预测的准确率。早期评估显示,当时最先进的模型,如T5变换器的微调版本,准确率约为66%,显著低于估计的人类表现87%。这一差距凸显了多跳推理的难度,并推动了模型架构和训练技术的进一步研究。后续模型,包括基于GPT-3架构的模型,提高了性能,但仍未达到人类水平的推理能力。截至2023年,最佳系统,通常结合检索增强生成或思维链提示,已达到70年代中期至80年代初的准确率,但该基准仍然是通用推理能力的挑战性测试。
影响与意义
StrategyQA已成为人工智能和机器学习社区广泛使用的基准,特别是在评估大型语言模型方面。其对多跳推理的强调影响了思维链提示等技术发展,这些技术鼓励模型在生成最终答案前产生中间推理步骤。该基准也被用于研究基于变换器模型的局限性,揭示它们往往依赖表面相关性而非真正推理。这引发了对神经符号方法和外部知识源整合的更大兴趣。
该数据集也被纳入更广泛的评估套件,如BIG-bench基准,该基准聚合多个任务以评估模型能力。其设计启发了其他领域的类似基准,包括科学推理和常识问答。研究人员指出,StrategyQA问题通常需要“开放域”知识,意味着模型必须访问训练数据中不存在的信息,这对检索增强系统的发展具有影响。
局限性与批评
尽管广受欢迎,StrategyQA面临若干批评。一些研究人员认为,是非格式过度简化了推理过程,因为模型可以通过猜测或利用数据集中的偏差达到中等准确率。例如,是非答案的分布并非完全平衡,某些问题包含可能无意中引导模型的词汇线索。此外,数据集中提供的支持事实并不总是足以回答问题,要求模型依赖可能不一致或过时的外部知识。
另一个局限性是数据污染的潜在风险,因为问题来源于公共来源,可能出现在大型语言模型的训练语料中。这可能夸大性能指标并掩盖真正的推理能力。为缓解这一问题,一些研究人员提出了动态基准,即时生成新问题,但StrategyQA仍然是静态资源。尽管存在这些问题,该基准继续是诊断模型弱点和推动多跳推理研究进展的宝贵工具。
未来方向
StrategyQA的经验教训已为更新基准的设计提供信息,这些基准旨在更加健壮和全面。例如,StrategyQA框架已扩展至包括多项选择和开放式生成任务,要求模型产生解释而非仅标签。人们也越来越有兴趣使用StrategyQA评估模型在专业领域(如科学发现和法律分析)中的推理能力。随着生成式人工智能系统变得更加能力强大,像StrategyQA这样的基准可能会演变,纳入更复杂的推理链,包括时间和因果推理,以跟上模型进步。
在深度学习研究的更广泛背景下,StrategyQA强调了超越模式识别走向真正理解的重要性。该基准催化了可解释性、提示策略以及符号推理与神经网络整合方面的工作。虽然尚无模型在StrategyQA上达到人类水平的表现,但该基准仍然是衡量智能最基本方面之一(即逐步推理能力)进展的关键标尺。