DROP(段落离散推理)是一个用于评估阅读理解与问答系统的基准数据集。它于2019年由卡内基梅隆大学和华盛顿大学的研究者提出。该数据集包含超过96,000个源自维基百科文章的问题,旨在要求进行离散推理操作,如加法、计数、排序和比较,而不仅仅是提取文本片段。这使得DROP区别于早期的阅读理解基准,如SQuAD,后者主要测试直接在段落中定位答案的能力。
DROP的创建源于以下观察:许多现有的问答模型擅长提取答案,但在处理需要结合文本多个部分信息或进行简单算术的问题时表现不佳。该基准旨在揭示这些局限性,并推动该领域朝着更强大的推理能力发展。DROP中的每个问题都与维基百科文章中的一个段落配对,答案可以是片段、数字、日期或项目列表。问题被设计为需要加法、减法、计数、排序和比较等操作,通常涉及时间或数值推理。
数据集结构与评估
DROP数据集分为训练集、开发集和测试集。训练集包含约77,000个问题,开发集约9,500个,测试集约9,500个。每个实例包括一个段落、一个问题以及一个或多个参考答案。评估使用精确匹配(EM)和F1分数进行,这些指标衡量预测答案与参考答案之间的重叠程度。由于答案可能是数字或列表,评估脚本会规范化格式,并处理逗号和日期格式等变体。
初始性能与挑战
当DROP发布时,当时表现最佳的模型实现了约30-40%的F1分数,远低于人类表现,后者估计约为96%的F1。该基准突显了现有神经模型在推理能力上的显著差距,特别是在处理数值运算和多步推理方面。早期解决DROP的尝试通常涉及混合系统,将神经阅读理解与符号推理模块(如算术计算器或程序生成器)相结合。
后续进展与技术
随着时间的推移,模型架构和训练方法的改进带来了DROP上的显著提升。Transformer基础模型的引入,特别是那些在大规模语料库上预训练的模型,有助于提高性能。像BERT及其后继者这样的模型,在DROP上进行微调后,取得了更高的分数,但仍难以应对复杂推理。后来,结合外部工具的方法,如程序合成或专门化损失函数,使模型能够执行显式算术操作。到2021年,一些系统的F1分数超过了85%,接近人类水平,这主要归功于大型预训练模型的使用以及符号推理组件的集成。
对AI研究的影响
DROP基准对自然语言处理和人工智能领域产生了持久影响。它促进了混合神经符号系统的研究,这些系统将神经网络与显式推理机制相结合。它还影响了更 challenging 的基准测试的开发,这些测试考验推理能力,例如需要多跳推理或数学问题解决的任务。DROP仍然是阅读理解与推理的标准评估工具,并且经常被纳入现代大型语言模型的训练和评估中。
相关基准与未来方向
DROP是更广泛的推理基准家族的一部分,包括序列到序列变换、基于多头注意力的模型以及课程学习方法等任务。虽然DROP专注于文本上的离散推理,但较新的基准已扩展到包括视觉推理、常识和多模态理解。截至2020年代初期,许多最先进的大型语言模型在DROP上作为其通用推理评估的一部分进行测试,该基准继续作为衡量机器理解进展的参考点。