英語からの翻訳

SQuAD 2.0は、10万件の回答可能な質問と5万件の回答不能な質問を組み合わせた質問応答データセットであり、モデルが回答が存在しない場合に棄権することを要求します。これは、読解力と頑健性をテストするために、2018年にスタンフォード大学の研究者らによって導入されました。

SQuAD 2.0(斯坦福问答数据集2.0)是一个机器阅读理解基准,它在原有SQuAD 1.1数据集的基础上,新增了50,000个不可回答的问题。这些不可回答的问题设计得看似合理,但在对应的维基百科文章中并无有效答案,从而迫使模型判断何时不存在答案,而非总是提取文本片段。该数据集总共包含超过150,000个问题,源自10个维基百科类别的536篇文章,由Pranav Rajpurkar、Robin Jia和Percy Liang于2018年6月在斯坦福人工智能实验室发布。

SQuAD 2.0的主要动机是解决早期阅读理解基准的一个局限:模型可以通过总是选择某个文本片段来获得高分,即使该问题实际上无法回答。通过加入不可回答的问题,该数据集要求系统首先判断答案是否存在,若存在再提取正确的文本片段。这使得任务更贴近实际应用场景,例如大型语言模型在搜索引擎和虚拟助手中的应用,其中问题往往缺乏明确的答案。

数据集构建

SQuAD 2.0中的不可回答问题由众包工作者创建,他们被展示一篇维基百科文章的段落,并被要求写出无法仅凭该段落回答、但人类读者可能会合理提出的问题。每个不可回答问题都配有一个主题和措辞相似的可回答问题,以确保不可回答问题不易被识别。最终数据集包含来自SQuAD 1.1的100,000个可回答问题,以及50,000个新增的不可回答问题,共计150,000个问答对。数据被划分为训练集(130,000个问题)、开发集(11,873个问题)和测试集(8,862个问题),其中测试集被隐藏用于官方评估。

评估指标

SQuAD 2.0使用两个主要评估指标:精确匹配(EM)和F1分数。EM衡量预测与标准答案完全匹配的百分比,而F1计算预测与标准答案之间词元重叠的精确率和召回率的调和平均值。对于不可回答的问题,模型必须输出“无答案”才能得分;任何文本片段预测都被视为错误。官方排行榜按EM和F1的平均值对系统进行排名,一个总是预测“无答案”的基线系统可获得0.0的F1分数,这凸显了任务的难度。

对NLP研究的影响

SQuAD 2.0成为评估阅读理解与问答系统的标准基准,推动了人工智能机器学习领域的广泛研究。它强调了模型在神经网络中判断不确定性(即“弃权”)和置信度估计的重要性,促进了融合答案验证或拒绝机制的架构发展。排行榜上的许多顶尖系统采用了基于Transformer的模型,如BERT、RoBERTa和ALBERT,这些模型在大规模语料库上预训练,并在SQuAD 2.0上进行微调。该数据集还影响了后续基准的制定,如Natural Questions和TyDi QA,这些基准同样将不可回答的实例作为核心组成部分。

局限性与批评

尽管SQuAD 2.0被广泛采用,但它也面临一些批评。不可回答问题由众包工作者人为生成,可能无法反映现实世界中不可回答查询的分布,后者往往涉及歧义或上下文缺失。此外,该数据集基于维基百科文章,这些文章结构相对规范且事实性强,使得模型更容易识别矛盾或缺失信息。一些研究者指出,在SQuAD 2.0上的高性能并不一定能转化为开放域问答中的稳健表现,因为开放域问答要求模型从大型语料库中检索相关段落。截至2025年,排行榜已趋于饱和,顶尖模型的F1分数超过95,但该数据集仍是评估模型稳健性和校准能力的重要工具。

相关工作与扩展

SQuAD 2.0催生了多个扩展和变体。该挑战赛在EMNLP 2018研讨会上被重点介绍,数据集也被用于自然语言处理的教学。它还被纳入多任务学习基准,用于评估深度学习模型的推理能力。不可回答问题的概念已被其他领域采纳,例如视觉问答和对话式AI,其中模型必须学会在不确定时提出澄清问题或明确表示不知道答案。该数据集仍是研究阅读理解的研究人员的重要资源,其设计原则持续影响着更具挑战性基准的创建。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·question-answering·dataset·reading-comprehension
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴