自然问题开放

译自英文

Natural Questions Open是一个面向开放域问答的基准数据集,源自Google搜索查询,其答案由人工标注。

Natural Questions Open 是一个用于开放域问答(QA)的基准数据集。它由谷歌于2019年作为 Natural Questions(NQ)数据集的一部分推出,该数据集包含用户向谷歌搜索引擎发出的真实匿名查询。'Open' 变体去除了单个维基百科页面的上下文,要求直接从大型语料库(如维基百科)回答问题,使其成为检索增强型问答系统的标准评估集。

该数据集包含超过30万个自然问题,每个问题都配有一个短答案(文本片段)和一个长答案(维基百科段落)。Open 版本正式名称为 Natural Questions - Open,通过丢弃页面级监督并评估系统从开放文档集合中查找答案的能力,简化了原始任务。这一设置已成为比较开放域问答模型(包括基于 Transformer 架构和大型语言模型的模型)的经典测试平台。

Natural Questions Open 的开发与 人工智能 领域的更广泛进展相一致,特别是在 机器学习深度学习 方面。该基准已被用于衡量基于神经网络(如 BERT 及后来的 生成式 AI 模型)构建的系统的性能。研究人员通常将 检索增强生成 与利用 多头注意力位置编码 的模型相结合,以对检索到的文本进行推理。

任务与评估

在开放域设置中,系统必须为每个问题返回一个答案,通常是短片段。评估使用精确匹配(EM)和 F1 分数指标,将预测答案与标注答案进行比较,并对标点和冠词进行归一化处理。整个数据集包含开发集和测试集划分,支持稳健的模型开发和比较。

系统通常采用两阶段方法:首先,检索器从维基百科中选择相关段落;其次,阅读器(通常是 编码器-解码器序列到序列 模型)提取答案。束搜索 解码和 top-k 采样 是生成答案的常见策略。

基准影响

Natural Questions Open 成为开放域问答中广泛采用的基准之一,与 SQuAD 和 TriviaQA 并列。它促进了检索增强架构的兴起,例如 REALM(2020年)和 RAG(2020年),这些架构结合了基于 Transformer 的检索和生成。2021年,Andorra 系统将检索器-阅读器架构与微调的 生成式 AI 模型相结合。该数据集也被 谷歌深度思维 和其他 人工智能 实验室用于推进问答能力。

开放域问答任务与原始 Natural Questions 的结构密切相关,后者包含更丰富的长答案标注。开放性使其成为 大型语言模型 系统的挑战,这些系统可能需要在没有显式检索的情况下给出答案。

近期发展

截至2020年代初,基于大型预训练模型的系统在测试集上取得了强劲结果,EM 分数超过50%。例如,谷歌研究团队2021年的一个模型在测试集上取得了54.6%的 EM,而结合检索与 生成式 AI 的方法后来达到了更高的56.4%。2022年,AI 实验室的公告指出应用 强化学习RLAIF 来对齐文本生成。然而,具体的排行榜声明可能随时间变化。

实际应用

Natural Questions Open 搜索的见解已影响商业系统,例如:检索退化中的问题稀释以及密集检索的需求被 谷歌云亚马逊网络服务 用于搜索。类似的集合也常用于评估语音助手和基于计算机的系统。尽管如此,该数据集仍是问答研究中的一个持续分支。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·question-answering·benchmark·dataset
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史