自然问答(Natural Questions)是一个用于开放域问答研究的大规模数据集,由谷歌研究人员于2019年提出。该数据集由用户向谷歌搜索引擎提交的真实匿名查询组成,每个查询都配有一个包含答案的维基百科页面,以及一个长答案(段落或表格)和一个短答案(短语或实体)(如适用)。其设计目的是将问答研究从单纯的阅读理解任务中拓展出来,聚焦于用户在搜索引擎中实际输入的真实信息需求,而非人工构造的问题。
该数据集的创建旨在解决早期问答数据集存在的局限性,这些数据集往往依赖合成问题,或假设答案一定存在于给定段落中。自然问答则反映了真实搜索行为的复杂性,包括模糊查询、多部分问题以及页面中不存在答案的情况。数据集包含307,373个训练样本、7,830个开发样本和7,842个测试样本,答案由人工标注者通过两阶段流程完成:首先识别长答案(段落或表格),然后从中提取短答案(短语或实体)。
自然问答迅速成为开放域问答领域的标准基准,补充了SQuAD等早期数据集。与SQuAD提供包含答案的段落不同,自然问答要求系统从大型语料库(通常是维基百科)中检索相关信息,然后提取答案。这一设置与后来成为大语言模型应用核心的检索增强生成范式相契合。该数据集已被广泛用于评估抽取式和生成式模型,并推动了密集检索技术的发展,例如Facebook AI于2020年提出的DPR(密集段落检索器)模型在该基准上取得了显著成果。
自然问答影响了后续问答数据集和系统的设计。其对真实用户查询的关注凸显了处理噪声、模糊性和无答案问题的重要性。该数据集还促进了从纯抽取式问答向生成式问答的转变,使模型能够综合答案而非简单复制文本片段。截至2020年代初,许多基于Transformer架构的最先进系统都在自然问答上进行了评测,包括使用BERT风格编码器进行检索和T5或GPT风格解码器进行生成的模型。该数据集至今仍被广泛引用,并常作为机器学习模型在自然语言处理领域的预训练或评估资源。
尽管影响深远,自然问答也存在一些局限性。该数据集仅以维基百科作为答案来源,可能无法全面反映网络内容的多样性。标注过程虽然严谨,但耗时且成本高昂,限制了数据集的规模,难以与自动生成的语料库相比。此外,一些研究人员指出,短答案标注可能存在不一致性,尤其是在问题具有多个有效答案或答案隐含的情况下。这些问题促使了补充数据集的开发,例如涵盖多种语言的TyDi QA,以及专注于长篇解释性答案的ELI5。
自然问答仍然是评估开放域问答系统的重要资源,尤其是在现代检索增强生成流程中。它也被用于学术研究,以探索模型的鲁棒性、可解释性,以及人机在真实查询上的性能差距。该数据集的设计原则,特别是对真实用户问题的重视,深刻影响了研究人员处理开放域问答的方式,并持续为新基准和模型提供参考。