영어에서 번역됨

RACE는 중국 중·고등학교 영어 시험에서 파생된 대규모 독해 이해 데이터셋으로, AI 모델이 긴 지문을 추론하고 객관식 질문에 답하는 능력을 평가하는 데 사용됩니다.

RACE(ReAding Comprehension from Examinations)是一个用于评估人工智能系统阅读理解与推理能力的基准数据集。该数据集由卡内基梅隆大学和微软研究院的研究人员于2017年提出,包含超过10万个多项选择题,题目来源于面向中国中学生举办的英语考试。该数据集的特点是强调长文本、复杂题型以及对深层推理能力的要求,而不仅仅是简单的文本匹配。

与早期通常依赖短文本或事实性查询的阅读理解数据集不同,RACE所提出的问题要求模型具备多种认知能力,包括推断隐含信息、理解叙事结构以及运用常识推理。该数据集主要分为两个子集:RACE-M(初中)和RACE-H(高中),其中高中部分因文章更长、问题更抽象而被普遍认为更具挑战性。

结构与组成

RACE共包含27,933篇文章和97,687道题目,并划分为训练集、验证集和测试集。文章均取自真实考试,每篇文章配有若干道四选一的选择题。文章平均长度约为320词,明显长于许多同时期的阅读理解基准数据集。这一长度要求模型能够在较长的上下文中保持理解,并从多个段落中定位相关信息。

RACE中的题目被划分为多种类型,包括事实性考查、推断性考查,以及对作者意图或人物动机的推理。该数据集的一个显著特点是包含大量“为什么”和“如何”类问题,这类问题通常需要综合文章不同部分的信息才能作答。

对人工智能研究的影响

RACE迅速成为评估阅读理解模型的标准基准。在该数据集发布之初,最先进的模型准确率仍远低于人类约95%的正确率。早期基于神经网络Transformer的模型在测试集上的准确率勉强超过60%。这一差距极大地推动了新架构和训练技术的研究。

该数据集在大语言模型生成式人工智能系统的发展中发挥了重要作用。随着模型规模的扩大以及在海量语料上的预训练,RACE上的性能得到了显著提升。到2021年,诸如OpenAI的GPT-3及其后续版本等模型在该数据集上的准确率已超过90%,接近人类水平。这一进展凸显了模型规模和预训练在解决复杂推理任务中的重要性。

与其他基准的比较

RACE常被用来与SQuAD(斯坦福问答数据集)和CNN/Daily Mail等其他阅读理解数据集进行比较。与侧重于抽取式问答(答案直接来源于文本片段)的SQuAD不同,RACE要求从预设选项中进行选择,且许多问题无法通过简单的文本查找来回答。这使得RACE成为对真实理解与推理能力的更具挑战性的测试。

该数据集的设计也影响了后续基准的构建,例如更具挑战性的RACE-C以及其他旨在暴露模型推理缺陷的对抗性数据集。研究人员还利用RACE来研究模型过度自信以及依赖表面线索而非深层理解等现象。

局限性与批评

尽管RACE被广泛使用,它也存在一定的局限性。一些研究人员指出,虽然该数据集的题目来源于真实考试,但其中可能包含偏见或歧义,使其在评估通用推理能力方面有所欠缺。例如,部分题目依赖于中国教育背景下的特定文化知识,这可能使主要在英文文本上训练的模型处于不利地位。此外,选择题的形式可能使模型利用答案选项中的统计规律,例如位置偏差或长度启发式。

为解决这些问题,研究者们构建了该数据集的改进版本,例如RACE-C,该版本增加了更具挑战性的题目并减少了表面线索的影响。这些变体目前仍被用于鲁棒阅读理解的相关研究。

遗产与持续使用

RACE至今仍是人工智能机器学习领域中被广泛引用的基准数据集。它被纳入多个模型评估体系,例如GLUE和SuperGLUE基准,并被Google DeepMindAnthropic等主要研究机构用于评估其模型的推理能力。该数据集的持久影响力源于其设计的前瞻性,它预见了后来成为人工智能研究核心的诸多挑战,例如长文本理解与多步推理。

截至2025年,RACE仍被用于学术研究和行业评估,尽管MMLU和BIG-bench等更新的基准在通用知识评估方面已部分取代了它的地位。然而,RACE对考试型题目的专注使其在衡量教育人工智能应用和自动化辅导系统进展方面仍具有重要价值。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:reading-comprehension·benchmark·dataset·nlp
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사