ReCoRD(阅读理解与常识推理)是一个用于评估人工智能系统推理能力(尤其在自然语言理解领域)的基准数据集。它由马里兰大学和华盛顿大学的研究人员于2018年提出。该数据集旨在衡量模型在阅读时进行常识推理的能力,超越了简单的事实检索或模式匹配。
ReCoRD中的核心任务涉及一段文本(通常取自新闻文章),其中某些实体已被遮蔽。模型必须从文本其他地方出现的候选实体列表中预测被遮蔽的实体。关键在于,正确答案通常需要理解上下文、解决指代消解,并应用未明确陈述的现实世界知识。例如,如果一段文本提到一个人和一个城市,而被遮蔽的实体是一个地点,模型必须根据叙述推断哪个城市是相关的。
ReCoRD包含超过12万个示例,分为训练集、验证集和测试集。文本段落来源于新闻文章,查询是通过遮蔽命名实体生成的。该数据集强调正确答案始终是候选实体之一,这些实体都在文本中提到,使其成为一个具有受限答案空间的完形填空式任务。这种设计迫使模型推理实体与所描述事件之间的关系,而不是依赖外部知识库。
构建与设计
ReCoRD数据集采用两阶段流程构建。首先,从各种来源收集新闻文章,并使用标准实体识别器识别命名实体。然后,对于每篇文章,通过随机遮蔽一个实体并提供同一篇文章中出现的候选实体列表来创建一组查询。候选实体包括正确答案和几个干扰项,这些干扰项是同一篇文章中的其他实体。这确保了模型不能简单地选择最频繁出现的实体或依赖表面统计特征。
ReCoRD的一个显著特点是其对常识推理的强调。查询的设计使得正确答案不能通过局部上下文直接确定。相反,模型必须整合多个句子的信息并推断隐含关系。例如,如果一段文本描述了一个人在特定领域获奖,模型必须知道该奖项通常与该领域相关,这是一种常识性知识。
数据集被划分为101,249个训练示例、6,353个验证示例和10,000个测试示例。测试集是保留的,模型通过提交系统进行评估。主要评估指标是精确匹配准确率,即模型预测的实体必须与地面真值完全匹配。
评估与性能
ReCoRD已成为自然语言处理领域的标准基准。早期模型(包括基于循环神经网络和早期Transformer架构的模型)在验证集上的准确率约为60-70%。大型预训练语言模型(如BERT及其后继者)的引入显著提高了性能,到2020年,一些模型的准确率超过了90%。
然而,即使是最先进的模型在某些需要深层常识推理的查询上仍然面临困难,例如涉及时间推理、空间推理或细致社会惯例的查询。这使得ReCoRD成为诊断当前AI系统局限性的宝贵工具。该基准也被用于研究模型规模、训练数据和架构选择对推理能力的影响。
与其他基准的关系
ReCoRD是更广泛的阅读理解基准家族的一部分,包括SQuAD、RACE和DROP。与SQuAD不同(后者侧重于从文本中提取答案片段),ReCoRD要求从一组实体中进行选择,使其成为一个多项选择完形填空任务。与基于英语考试的RACE相比,ReCoRD的新闻领域提供了更多样化和不那么正式化的上下文。DROP需要数值推理,而ReCoRD则强调常识推断。
ReCoRD通常与其他基准结合使用,以提供对模型能力的全面评估。它特别适合测试Artificial intelligence和Machine learning技术在自然语言理解中的整合。该基准已被主要机构的研究团队(包括Google DeepMind、OpenAI和Anthropic)采纳,作为其模型评估套件的一部分。
影响与未来方向
ReCoRD的引入推动了AI领域常识推理的进一步研究。它突出了模式识别与真正理解之间的差距,促使人们努力开发能够推理日常情境的模型。后续基准(如CommonsenseQA和Social IQA)在ReCoRD的经验教训基础上发展,更侧重于显式的常识知识。
ReCoRD的一个局限性是候选实体都来自同一段落,这有时会使任务变得更容易,如果模型学会利用统计线索。研究人员提出了引入外部知识或需要多跳推理的变体。尽管存在这些挑战,ReCoRD仍然是一个被广泛引用和使用的基准,它继续为开发更稳健和可解释的AI系统提供信息。
截至2020年代初,ReCoRD仍被视为一个相关基准,尽管较新的模型通常能达到接近完美的分数。它的遗产在于展示了常识推理在自然语言理解中的重要性,并为衡量这一领域的进展提供了一个具体任务。