译自英文

SQuAD v2.0是一个阅读理解数据集,在SQuAD 1.1的基础上扩展了不可回答的问题,用于测试模型在无答案存在时放弃回答的能力。该数据集包含来自维基百科文章的100,000个可回答问题和50,000个不可回答问题,由斯坦福大学研究人员于2018年提出。

SQuAD v2.0(斯坦福问答数据集2.0版)是一个用于机器阅读理解与问答的基准数据集。它在原始SQuAD 1.1数据集的基础上,增加了大量不可回答的问题,要求模型不仅要提取正确的答案片段,还要识别出问题在给定上下文中是否无法回答。这一设计解决了早期数据集的一个关键局限,即模型可以通过猜测答案片段而获得高分,而无需真正理解文本。

该数据集由斯坦福大学的一个团队于2018年6月推出,主要成员包括Pranav Rajpurkar、Robin Jia和Percy Liang。它包含100,000个可回答问题和50,000个不可回答问题,全部源自SQuAD 1.1中使用的同一组维基百科文章。不可回答问题由人类标注者撰写,他们改写看似合理但实际并不被文章文本支持的问题,使其难以与可回答问题区分开来。

动机与设计

SQuAD v2.0的主要动机是解决阅读理解系统中的“过度自信”问题。在SQuAD 1.1中,每个问题在上下文中都有保证的答案片段,因此模型可以被训练为总是提取某些内容,即使不正确。这导致系统在基准测试中表现良好,但在现实应用中却失败,因为现实中的问题往往没有答案。通过引入不可回答问题,SQuAD v2.0迫使模型学习一种更稳健的技能:在提取片段之前先判断可回答性。

构建过程涉及众包工作者,他们首先根据段落撰写可回答问题,然后撰写看似合理但不可回答的额外问题,通常通过改变实体、数字或关系来实现。这确保了不可回答问题在语义上与可回答问题相似,从而使任务真正具有挑战性。

评估指标

SQuAD v2.0使用两个主要指标:精确匹配(EM)和F1分数。然而,与SQuAD 1.1不同,评分对不可回答问题有特殊处理。对于不可回答问题,如果模型预测“无答案”(空片段),则获得满分(EM=1,F1=1)。如果它预测任何非空片段,则两个指标均为零。对于可回答问题,则计算标准的片段级EM和F1。总体得分是所有问题的平均值,对可回答和不可回答实例给予同等权重。

这种评分方案激励模型保持保守:它们必须在回答可回答问题的精确性与错误回答不可回答问题的风险之间取得平衡。一个总是猜测答案的模型在不可回答的一半上得分接近零,而一个总是弃权的模型在可回答的一半上得分为零。

对研究的影响

SQuAD v2.0迅速成为NLP社区中的标准基准,与其前身并列。它推动了更复杂模型的发展,这些模型将可回答性预测作为显式组件。许多早期的深度学习方法,例如基于变换器的方法,都在该数据集上进行了评估,从而带来了快速改进。

该数据集还影响了后来基准的设计,如Natural QuestionsTriviaQA,这些基准自然包含不可回答问题。它强调了问答中校准和弃权的重要性,这一主题在现代大型语言模型中仍然相关。

排行榜与最新进展

发布时,最佳模型的EM分数约为60-65%,显著低于SQuAD 1.1上的80%以上分数,反映了增加的难度。随着时间的推移,模型有了显著改进。到2019年,使用BERT及其变体的系统达到了80%以上的EM分数。截至2023年,官方排行榜上的顶尖条目实现了90%以上的EM分数,通常使用集成方法和外部知识。

尽管分数很高,研究人员指出SQuAD v2.0仍有局限性,例如依赖维基百科以及不可回答问题的人为构造性质。尽管如此,它仍然是评估阅读理解稳健性的宝贵工具。

相关工作与扩展

SQuAD v2.0启发了多个后续数据集和任务。例如,squad-shift引入了分布偏移来测试泛化能力,而其他工作则探索了对抗性扰动。可回答性的概念已被纳入许多问答系统,包括谷歌云亚马逊网络服务等公司生产环境中使用的系统。

该数据集免费供研究使用,并托管在官方SQuAD网站上,同时提供评估脚本和公共排行榜。它继续作为机器理解领域比较新架构和训练技术的参考点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·question-answering·dataset·machine-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史