BoolQ(布尔问题)是一个用于自然语言理解的数据集,用于评估机器根据给定文章段落回答是/否问题的能力。该数据集于2019年由克里斯托弗·克拉克、肯顿·李、张明伟、汤姆·科维亚特科夫斯基、迈克尔·柯林斯和克里斯蒂娜·图塔诺娃提出,他们分别来自卡内基梅隆大学和谷歌AI语言团队。数据集包含15,942个问题,每个问题配有一段来自维基百科的短文,答案为二元(是或否)。这些问题由人类标注者根据文章内容自然生成,因此比基于模板的合成问题更真实、更具挑战性。
BoolQ是SuperGLUE基准测试的一部分,该基准测试旨在评估通用语言理解模型。在SuperGLUE中,BoolQ用于测试模型的阅读理解能力和逻辑推理能力,要求模型从段落中识别相关信息并做出简单但往往微妙的判断。数据集的难度在于答案并非总是明确陈述,模型必须从上下文中推断答案,处理否定表述,并应对可能存在多种合理解释的问题。
构建与标注
BoolQ数据集的构建过程首先从维基百科文章中选取涵盖历史、科学、文化等多个主题的段落。然后,标注者被要求根据段落内容撰写一个可以用是或否回答的问题。他们被指示避免过于简单或过度依赖外部知识的问题,以确保问题真正需要理解文章内容。每个问题随后由另一组标注者回答,最终标签由多数投票决定。数据集被划分为9,427个训练样本、3,270个开发样本和3,245个测试样本,其中测试集保留用于官方评估。
任务与评估
在BoolQ任务中,模型需要输入一段文章和一个问题,并输出“是”或“否”的答案。主要评估指标是准确率,即正确回答的问题所占的百分比。随机猜测的准确率为50%,而人类在该数据集上的表现估计约为90%,这表明任务需要复杂的推理能力。早期模型(如基于Transformer (architecture)架构的模型)在首次测试中准确率约为60-70%。随着Large language model和Neural network方法的发展,特别是针对BoolQ进行微调的模型,到2021年,最先进的模型准确率已超过90%。
挑战与意义
BoolQ为Machine learning系统带来了多项挑战。问题通常包含预设前提,或要求模型处理复杂的语言现象,如指代消解、时间推理和世界知识。例如,问题“滑铁卢战役是在19世纪发生的吗?”要求模型在段落中定位日期并将其映射到正确的世纪。此外,段落内容并非总是与问题直接相关,模型需要过滤掉无关信息。BoolQ对阅读理解研究产生了重要影响,并被用作评估Artificial intelligence系统的基准,包括由OpenAI、Anthropic和Google DeepMind等机构开发的系统。
与其他基准的关系
BoolQ是SuperGLUE基准测试中的数据集之一,该基准还包括MultiRC(多句阅读理解)、ReCoRD(基于常识推理的阅读理解)和COPA(因果推理)等任务。与一些专注于抽取式问答(答案是一段文本片段)的基准不同,BoolQ要求二元判断,因此更直接地测试模型的理解能力。它也与早期的SQuAD(斯坦福问答数据集)相关,但不同之处在于SQuAD的问题通常可以通过文本片段回答,而BoolQ的问题设计得更开放,需要推理。
对模型发展的影响
BoolQ已被广泛用于Deep learning模型的开发与评估。它是Transformer (architecture)模型(如BERT和RoBERTa)发展过程中的关键基准,这些模型在BoolQ上相比早期方法取得了显著进步。该数据集也用于研究模型的局限性,例如模型倾向于依赖表面线索或容易被对抗性样本误导。截至2024年,BoolQ仍然是自然语言处理研究中的标准评估工具,经常被纳入新Large language model的训练和测试中,为Generative AI领域的更广泛发展做出了贡献。