译自英文

SQuAD 2.0是一个问答数据集,结合了100,000个可回答的问题和50,000个不可回答的问题,要求模型在无法回答时放弃作答。该数据集由斯坦福大学的研究人员于2018年推出,旨在测试阅读理解能力和鲁棒性。

数据集构建

SQuAD 2.0 中的不可回答问题由众包工作者创建,他们被展示来自维基百科文章的段落,并被要求写出无法仅从该段落回答的问题。每个不可回答的问题都与一个可回答的问题配对,后者在主题和措辞上相似,以确保不可回答的问题并非微不足道。最终数据集包含来自 SQuAD 1.1 的 100,000 个可回答问题和 50,000 个新的不可回答问题,共计 150,000 个问题-答案对。数据被划分为训练集(130,000 个问题)、开发集(11,000 个)和测试集(8,862 个),其中测试集未公开。

评估指标

SQuAD 2.0 使用两种主要的评估指标:精确匹配(EM)和 F1 分数。EM 衡量预测与某个真实答案完全匹配的百分比。F1 分数则计算预测与真实答案之间词元重叠的精确率和召回率的调和平均值。对于不可回答的问题,模型必须预测“无答案”才能获得分数;任何具体的答案预测都被视为错误。官方排行榜根据所有问题的平均 EM 和 F1 分数对模型进行排名,其中预测“无答案”的基线模型可获得约 50% 的 EM 和 F1 分数。

影响与意义

SQuAD 2.0 已成为评估机器阅读理解系统的重要基准,推动了该领域的显著研究进展。它促使模型不仅需要定位答案,还需要判断问题是否可回答,从而推动了更稳健的阅读理解模型的发展。该数据集在 EMNLP 2018 研讨会上作为挑战赛发布,并已被广泛用于评估大型语言模型的推理能力。SQuAD 2.0 的设计理念也启发了其他领域的类似基准,例如视觉问答和对话式人工智能。

局限性

尽管 SQuAD 2.0 被广泛采用,但它也存在一些局限性。不可回答的问题是由众包工作者生成的,可能无法完全反映现实世界中问题的分布,例如那些涉及模糊性或缺乏上下文的问题。此外,该数据集基于维基百科文章,这些文章通常结构良好且事实性强,这可能使得模型更容易识别矛盾或缺失的信息。一些研究人员指出,在 SQuAD 2.0 上取得的高性能并不一定意味着在开放域问答任务中也能表现出色,因为后者需要模型从大型语料库中检索相关段落。截至 2025 年,该排行榜已趋于饱和,顶级模型的 F1 分数超过 95,但该数据集仍然是评估模型鲁棒性和校准能力的有价值工具。

相关工作和扩展

SQuAD 2.0 已催生了许多扩展和变体。该数据集已被纳入多任务学习基准,并用于评估深度学习模型的推理能力。不可回答问题的概念也已被其他领域采用,例如视觉问答和对话式人工智能,在这些领域中,模型必须学会请求澄清或表明自己不知道答案。该数据集仍然是研究阅读理解的研究人员的重要资源,其设计原则继续为创建更具挑战性的基准提供信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·question-answering·dataset·reading-comprehension
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史