译自英文

BoolQ是一个自然语言处理基准数据集,用于布尔型问题回答,模型需根据维基百科段落回答是/否问题。该数据集由卡内基梅隆大学和Google AI Language的研究人员于2019年推出。

BoolQ(布尔问题)是一个用于自然语言理解的数据集,用于评估机器根据给定文本段落回答是/否问题的能力。该数据集于2019年由来自卡内基梅隆大学和谷歌AI语言的Christopher Clark、Kenton Lee、Ming-Wei Chang、Tom Kwiatkowski、Michael Collins和Kristina Toutanova提出。数据集包含15,942个问题,每个问题都配有一段来自维基百科的短文和一个二元答案(是或否)。这些问题都是自然发生的,由人类标注者根据段落内容被要求构思问题而生成,这使得它们比合成或基于模板的查询更真实、更具挑战性。

BoolQ是SuperGLUE基准测试的一部分,该基准是一套旨在评估通用语言理解模型的任务集合。在SuperGLUE中,BoolQ作为阅读理解与逻辑推理的测试,要求模型识别段落中的相关信息,并做出简单但往往细微的决策。该数据集的难度在于答案并不总是明确陈述的;模型必须从上下文中推断答案,处理否定,并应对可能具有多种合理解释的问题。

构建与标注

BoolQ数据集的构建首先从维基百科文章中选取涵盖历史、科学和文化等多样主题的段落。然后,标注者会看到一段文字,并被要求写出一个可以使用文本信息回答的是/否问题。他们被指示避免过于简单或过于依赖外部知识的问题,以确保问题需要真正理解段落内容。每个问题随后由另一组标注者回答,多数投票决定最终标签。数据集被分为9,427个训练示例、3,270个开发示例和3,245个测试示例,其中测试集被保留用于官方评估。

任务与评估

在BoolQ任务中,模型被给定一段文字和一个问题,必须输出“是”或“否”。主要评估指标是准确率,即正确回答问题的百分比。随机猜测会达到50%的准确率,但人类在该数据集上的表现估计约为90%,这表明需要复杂的推理能力。早期模型,例如基于Transformer (architecture)架构的模型,在此任务上表现困难,首批发表的结果准确率约为60-70%。Large language modelNeural network方法的引入,特别是针对BoolQ进行微调的模型,显著提升了性能,到2021年,最先进的模型准确率已超过90%。

挑战与意义

BoolQ为Machine learning系统带来了多项挑战。问题常常包含预设,或要求模型处理复杂的语言现象,如指代消解、时间推理和世界知识。例如,像“滑铁卢战役是在19世纪进行的吗?”这样的问题要求模型在段落中定位日期并将其映射到正确的世纪。此外,段落并不总是与问题直接相关,要求模型过滤掉无关信息。BoolQ在推动阅读理解研究方面具有影响力,并已被用作评估Artificial intelligence系统的基准,包括由OpenAIAnthropicGoogle DeepMind开发的系统。

与其他基准的关系

BoolQ是SuperGLUE基准中的多个数据集之一,该基准还包括MultiRC(多句阅读理解)、ReCoRD(常识推理阅读理解)和COPA(因果推理)等任务。与其他一些侧重于抽取式问答(答案是一段文本)的基准不同,BoolQ要求二元决策,使其成为更直接的测试理解能力的工具。它也与早期的SQuAD(斯坦福问答数据集)相关,但不同之处在于SQuAD问题通常可以用一段文字回答,而BoolQ问题设计得更开放,需要推理。

对模型开发的影响

BoolQ已被广泛用于Deep learning模型的开发与评估。它是基于Transformer (architecture)的模型(如BERT和RoBERTa)开发中的关键基准,这些模型相比之前的方法显示出显著进步。该数据集也被用于研究模型的局限性,例如它们依赖表面线索的倾向,或容易被对抗性示例误导。截至2024年,BoolQ仍然是自然语言处理研究中的标准评估工具,并且经常被纳入新Large language model的训练和测试中,为更广泛的Generative AI领域做出贡献。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·dataset·benchmark·question-answering
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史