英語からの翻訳

DROPは、テキストに対する離散的な推論(算術や並べ替えなど)を、単純な抽出を超えて必要とする読解理解ベンチマークです。2019年に導入され、多段階の推論を要求する質問でAIシステムに挑戦することを目的としています。

DROP(段落离散推理)是一个用于评估阅读理解与问答系统的基准数据集。该数据集于2019年由卡内基梅隆大学和华盛顿大学的研究人员提出。数据集包含超过96,000个源自维基百科文章的问题,旨在要求进行离散推理操作,如加法、计数、排序和比较,而非仅仅提取文本片段。这使得DROP区别于早期的阅读理解基准(如SQuAD),后者主要测试直接在段落中定位答案的能力。

DROP的创建源于观察到许多现有的问答模型擅长提取答案,但在处理需要结合文本多个部分信息或执行简单算术的问题时表现不佳。该基准旨在揭示这些局限性,并推动该领域向更强大的推理能力发展。DROP中的每个问题都与一段维基百科文章配对,答案可以是片段、数字、日期或项目列表。问题的设计旨在要求进行加法、减法、计数、排序和比较等操作,通常涉及时间或数值推理。

数据集结构与评估

DROP数据集分为训练集、开发集和测试集。训练集包含约77,000个问题,开发集约9,500个,测试集约9,500个。每个实例包括一段文章、一个问题以及一个或多个参考答案。评估采用精确匹配(EM)和F1分数,用于衡量预测答案与参考答案之间的重叠程度。由于答案可能是数字或列表,评估脚本会规范化格式,并处理逗号和日期格式等变体。

初始性能与挑战

当DROP发布时,当时表现最佳的模型F1分数约为30-40%,远低于人类表现(估计约为96% F1)。该基准凸显了现有神经模型在推理能力方面的显著差距,尤其是在处理数值运算和多步推理方面。早期解决DROP的尝试通常涉及混合系统,将神经阅读理解与符号推理模块(如算术计算器或程序生成器)相结合。

后续进展与技术

随着时间的推移,模型架构和训练方法的改进带来了DROP性能的显著提升。基于Transformer的模型(尤其是那些在大规模语料库上预训练的模型)的引入有助于提高性能。像BERT及其后继模型在DROP上微调后取得了更高的分数,但仍难以应对复杂推理。后来,结合外部工具的方法,如程序合成专门损失函数,使模型能够执行显式算术运算。到2021年,一些系统的F1分数超过85%,接近人类水平,这主要归功于大型预训练模型的使用和符号推理组件的集成。

对AI研究的影响

DROP基准对自然语言处理人工智能领域产生了持久影响。它促进了混合神经符号系统的研究,这些系统将神经网络与显式推理机制相结合。它还影响了更富挑战性的基准的开发,这些基准测试推理能力,如需要多跳推理或数学问题解决的任务。DROP仍然是阅读理解与推理的标准评估工具,并经常被纳入现代大型语言模型的训练和评估中。

相关基准与未来方向

DROP是更广泛的推理基准家族的一部分,包括序列到序列转换、基于多头注意力的模型以及课程学习方法等任务。虽然DROP侧重于文本上的离散推理,但更新的基准已扩展到包括视觉推理、常识和多模态理解。截至2020年代初,许多最先进的大型语言模型在DROP上作为其一般推理评估的一部分进行测试,该基准继续作为衡量机器理解进展的参考点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:benchmark·reading-comprehension·reasoning·nlp
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴