MMLU基准(大规模多任务语言理解)是评估大型语言模型能力的广泛使用的工具。该基准由Dan Hendrycks及其研究团队于2020年9月7日发布,其设计初衷是比GLUE等早期基准更具挑战性,因为当时模型在较简单的测试中已开始超越人类表现。MMLU包含15,908道多项选择题,涵盖57个学科领域,从STEM领域到国际法、营养学乃至宗教研究不等。其中1,540道题被专门保留用于优化模型设置,如温度参数、批处理大小和学习率等。截至2024年7月,该基准已被下载超过1亿次,成为人工智能社区中比较模型性能最常用的工具之一。
在MMLU刚推出时,大多数现有模型的得分接近随机猜测水平(25%),而当时表现最好的模型GPT-3 175B也仅达到43.9%的准确率。基准创建者估计,人类领域专家的平均得分约为89.8%。然而,到2024年年中,Claude 3.5 Sonnet、GPT-4o和Llama 3.1 405B等领先模型已持续达到约88%的准确率。但截至2025年,MMLU已逐渐被更难的替代基准所取代,这反映了模型能力的快速进步。
结构与内容
该基准涵盖广泛学科,包括抽象代数、国际法、专业医学等。每道题均为四选一的多项选择题,模型在所有学科上的准确率被用作评估指标。题目的多样性旨在不仅测试模型的事实性知识,还考察其推理能力和跨领域理解能力。其中1,540道开发集题目专门用于调整超参数,以确保不同模型之间的公平比较。
MMLU还催生了多个衍生基准,如MMLU-Pro、MMMU和MMLU-Redux,这些变体旨在解决原始基准的某些局限性或提供更具挑战性的评估。这些衍生工具推动了机器学习领域模型评估方法的持续演进。
局限性与批评
尽管MMLU广受欢迎,它也面临不少批评。2024年6月5日,专家团队发布了一篇论文,对5,700道题目进行了人工分析,发现其中存在大量标注错误。例如,在“病毒学”子集中,有相当比例的题目被发现存在问题,包括4%的题目存在多个正确答案、14%的题目表述不清、33%的题目答案完全错误。总体而言,该分析估计MMLU中约6.5%的题目存在错误,这意味着模型理论上可达到的最高分数远低于100%。
数据污染也是该基准面临的严重威胁。一些公司可能有意或无意地将MMLU的题目和答案纳入其模型的训练数据中,这实际上削弱了该基准作为泛化能力衡量标准的有效性。这一问题在生成式人工智能评估领域普遍存在,因为模型训练常常使用包含基准题目在内的大规模互联网语料库。
示例题目
以下示例展示了MMLU中“抽象代数”、“国际法”和“专业医学”三个学科的典型题目类型。正确答案以粗体标注。
题目1(抽象代数):
找出所有 \( c \in \mathbb{Z}_3 \),使得 \( \mathbb{Z}_3[x]/(x^2 + c) \) 构成一个域。
(A) 0 (B) 1 (C) 2 (D) 3
题目2(国际法):
对《公民权利和政治权利国际公约》(ICCPR)中关于酷刑的定义提出保留,在当代实践中是否可以接受?
(A) 如果保留国国内立法采用了不同定义,则该保留可以接受。
(B) 该保留不可接受,因为它违背了ICCPR的宗旨和目的。
(C) 该保留不可接受,因为ICCPR中关于酷刑的定义与国际习惯法一致。
(D) 该保留可以接受,因为根据国际法,国家有权对条约提出保留。
题目3(专业医学):
一名33岁男性因甲状腺癌接受了根治性甲状腺切除术。术中因中度出血需结扎颈部左侧多根血管。术后血清学检查显示:血钙7.5 mg/dL,白蛋白4 g/dL,甲状旁腺激素200 pg/mL。该患者的表现是由哪条血管受损所致?
(A) 颈肋干分支
(B) 颈外动脉分支
(C) 甲状颈干分支
(D) 颈内静脉属支
影响与未来
MMLU在追踪大型语言模型发展进程方面发挥了关键作用,被OpenAI、Anthropic和Google DeepMind等研究机构和公司广泛采用。其影响力还延伸至其他基准测试和评估方法论的开发,推动了整个领域向更严格、更全面的测试体系发展。然而,随着标注错误问题的暴露和数据污染风险的加剧,研究社区已逐步转向更能抵抗这些问题的更新基准。截至2025年,MMLU虽然仍作为历史参考点被引用,但在前沿模型比较中的核心地位已逐渐被更先进的评估工具所取代。