译自英文

DuoRC是一个阅读理解数据集,包含从7,680部电影情节摘要中提取的186,089个问答对,旨在通过需要跨多个句子进行推理的问题来测试机器对长篇叙事的理解能力。

DuoRC是一个大规模阅读理解数据集,于2018年由印度理工学院(IIT)马德拉斯分校和卡内基梅隆大学的研究人员推出。该数据集包含186,089个问答对,这些问答对基于来自维基百科和IMDb的7,680个电影剧情摘要生成。与许多依赖单句或短段落上下文的早期数据集不同,DuoRC侧重于长篇多段落叙事,要求模型综合多个句子和事件中的信息。

该数据集的构建采用了两阶段流程。首先,Amazon Mechanical Turk的众包工作者根据维基百科的剧情摘要撰写问题,这些摘要通常语气中立且不含剧透。随后,另一组工作者使用IMDb上相应的剧情摘要来回答这些问题,而IMDb的摘要更为详细且常含剧透。这种问题生成上下文与答案查找上下文之间的刻意不匹配,迫使模型依赖更深层的理解而非简单的词汇匹配,因为答案可能不会逐字出现在用于创建问题的源文本中。

构建与标注

DuoRC中的每部电影都有两份不同的剧情摘要:一份来自维基百科(平均长度约1,000词),另一份来自IMDb(平均长度约2,000词)。标注过程涉及多个质量控制步骤,包括过滤掉可从单个句子回答的问题,并确保答案是存在于IMDb摘要中的文本片段。最终数据集包含训练集96,311个问题,验证集12,792个,测试集76,986个,总计186,089个问答对。

DuoRC中的问题主要为“什么”、“谁”、“为什么”和“如何”类型,其中相当比例需要多句推理。例如,一个问题可能询问角色为何以某种方式行事,而答案需要从三四个不同段落中获取信息。这使得DuoRC区别于SQuAD等数据集,在后者中大多数答案位于单个句子或相邻句子内。

评估与基线

DuoRC采用标准阅读理解指标:精确匹配(EM)和F1分数。在首次发布时,作者评估了多种基线模型,包括传统基于特征的系统和早期神经模型。当时表现最佳的基线模型EM分数约为14%,F1分数约为24%,显著低于估算的人类表现(EM为78%,F1为86%)。这一巨大差距凸显了长上下文推理的难度,并推动了该领域的进一步研究。

后续基于Transformer (architecture)架构的模型,如大型语言模型,已大幅提升了性能。然而,即使是现代系统也难以应对DuoRC中最复杂的问题,尤其是那些需要跨段落推理和时间推理的问题。该数据集仍是自然语言处理研究中评估长文档理解能力的基准。

与其他数据集的关系

DuoRC旨在补充现有的阅读理解数据集。与SQuAD(使用短维基百科文章)或RACE(使用考试题目)不同,DuoRC提供更长的上下文和独特的问题-答案不匹配。这种设计选择使其特别适合研究模型能否超越简单模式匹配进行泛化。该数据集已用于多跳推理、机器阅读理解和问答系统的研究。

创建者还发布了一个子集,名为DuoRC-Paraphrase,其中包含原始问题的改写版本,使研究人员能够测试模型对语言变化的鲁棒性。该子集已被用于评估模型对问题措辞表层变化敏感性的能力。

影响与局限性

DuoRC在人工智能社区中被广泛引用,被视为长上下文理解的挑战性基准。它影响了后续数据集的设计,例如NarrativeQA,后者同样使用书籍和电影情节。然而,DuoRC存在局限:电影剧情摘要受版权保护,限制了重新分发;且数据集主要为英文,限制了跨语言研究。

另一个局限是问题由众包工作者生成,可能引入偏见或不一致性。某些问题可能有多个有效答案,且基于文本片段(span)的答案格式无法涵盖所有推理类型。尽管存在这些问题,DuoRC仍是评估和改进需要处理长篇叙事文本模型的宝贵资源。

未来方向

随着大型语言模型生成式AI的兴起,DuoRC已被用于测试这些模型能否处理长形式推理。近期评估显示,GPT-4和Claude等模型可获得更高分数,但在最难的问题上仍达不到人类水平。研究人员继续利用DuoRC来探测现有系统的弱点,如幻觉现象以及在长篇章中跟踪角色关系的失败。

该数据集还作为测试平台,用于开发针对长序列的新型注意力机制和记忆增强网络。随着深度学习模型在处理长上下文方面变得更高效,DuoRC很可能仍是衡量叙事文本机器理解进展的标准基准。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·reading-comprehension·dataset·benchmark
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史