Natural Questions Open 是一个用于开放域问答(QA)的基准数据集。它由谷歌于2019年作为 Natural Questions(NQ)数据集的一部分推出,该数据集包含用户向谷歌搜索引擎发出的真实匿名查询。'Open' 变体去除了单个维基百科页面的上下文,要求直接从大型语料库(如维基百科)回答问题,使其成为检索增强型问答系统的标准评估集。
该数据集包含超过30万个自然问题,每个问题都配有一个短答案(文本片段)和一个长答案(维基百科段落)。Open 版本正式名称为 Natural Questions - Open,通过丢弃页面级监督并评估系统从开放文档集合中查找答案的能力,简化了原始任务。这一设置已成为比较开放域问答模型(包括基于 Transformer 架构和大型语言模型的模型)的经典测试平台。
Natural Questions Open 的开发与 人工智能 领域的更广泛进展相一致,特别是在 机器学习 和 深度学习 方面。该基准已被用于衡量基于神经网络(如 BERT 及后来的 生成式 AI 模型)构建的系统的性能。研究人员通常将 检索增强生成 与利用 多头注意力 和 位置编码 的模型相结合,以对检索到的文本进行推理。
任务与评估
在开放域设置中,系统必须为每个问题返回一个答案,通常是短片段。评估使用精确匹配(EM)和 F1 分数指标,将预测答案与标注答案进行比较,并对标点和冠词进行归一化处理。整个数据集包含开发集和测试集划分,支持稳健的模型开发和比较。
系统通常采用两阶段方法:首先,检索器从维基百科中选择相关段落;其次,阅读器(通常是 编码器-解码器 或 序列到序列 模型)提取答案。束搜索 解码和 top-k 采样 是生成答案的常见策略。
基准影响
Natural Questions Open 成为开放域问答中广泛采用的基准之一,与 SQuAD 和 TriviaQA 并列。它促进了检索增强架构的兴起,例如 REALM(2020年)和 RAG(2020年),这些架构结合了基于 Transformer 的检索和生成。2021年,Andorra 系统将检索器-阅读器架构与微调的 生成式 AI 模型相结合。该数据集也被 谷歌深度思维 和其他 人工智能 实验室用于推进问答能力。
开放域问答任务与原始 Natural Questions 的结构密切相关,后者包含更丰富的长答案标注。开放性使其成为 大型语言模型 系统的挑战,这些系统可能需要在没有显式检索的情况下给出答案。
近期发展
截至2020年代初,基于大型预训练模型的系统在测试集上取得了强劲结果,EM 分数超过50%。例如,谷歌研究团队2021年的一个模型在测试集上取得了54.6%的 EM,而结合检索与 生成式 AI 的方法后来达到了更高的56.4%。2022年,AI 实验室的公告指出应用 强化学习 与 RLAIF 来对齐文本生成。然而,具体的排行榜声明可能随时间变化。
实际应用
Natural Questions Open 搜索的见解已影响商业系统,例如:检索退化中的问题稀释以及密集检索的需求被 谷歌云 和 亚马逊网络服务 用于搜索。类似的集合也常用于评估语音助手和基于计算机的系统。尽管如此,该数据集仍是问答研究中的一个持续分支。