MMLU,全称“大规模多任务语言理解”(Massive Multitask Language Understanding),是由Dan Hendrycks及其合作者于2020年提出的一个基准,用于衡量语言模型的知识广度和推理能力。它包含约15,900道多项选择题,涵盖57个学科,包括初等数学、美国历史、计算机科学、法律和医学专业等,题目大多取自真实考试和教科书,难度从小学水平到专业及专家级不等。
设计与目的
MMLU的设计初衷是测试模型主要通过在大规模文本语料上进行预训练而非针对特定任务微调所应获得的广泛世界知识,因此它衡量的是模型跨学科的知识储备,而非其在某一狭窄任务上的表现。其创建者Dan Hendrycks后来成为著名的AI安全研究者,并创立了人工智能安全中心,而MMLU的构建也反映了早期将大语言模型评估从阅读理解或单领域问答等狭窄基准,向更接近通用知识的方向推进的努力。
采用情况
MMLU在GPT-3及后续大语言模型时代发布后,迅速成为模型发布论文和技术报告中最常被引用的基准之一,几乎所有主要实验室,包括OpenAI、Anthropic、Google DeepMind和Meta AI,都将其作为核心能力指标。其广泛使用使其成为不同机构采用不同方法训练出的模型之间的常见比较点,其作用类似于ImageNet在十年前对计算机视觉领域所扮演的角色。
饱和现象
早期语言模型在四选项题目上的得分仅略高于随机猜测的25%预期值,但随着模型规模的扩大,性能迅速提升:几年内模型得分超过80%,到2024年,领先的前沿模型已超过90%,接近专家人类小组可能达到的估计分数。这种饱和降低了MMLU区分顶级模型的能力,促使了更难的后续基准的诞生,包括MMLU-Pro,后者增加了更难的题目并扩充了选项数量,以减少猜测的影响。
批评
MMLU在多个方面受到批评:研究人员发现原始数据集中存在一定比例的错误或含糊不清的题目及参考答案;由于题目取自公开的考试材料,数据污染是一个持续关注的问题,因为部分题目或近似重复内容很可能出现在许多模型预训练所使用的大规模网络数据中;此外,多项选择题形式更偏向于识别而非生成,这可能无法反映模型在开放式任务中的实际使用方式。这些问题在后续版本中得到部分解决,但MMLU的核心设计仍停留在2020年代评估优先级的缩影。
遗产
尽管存在饱和和批评,MMLU仍被广泛引用为模型比较中的基线参考点,并继续出现在发布公告中,即使它已不再能有效区分顶级模型。这反映了一种更广泛的模式,即具有影响力的基准在其区分能力消退后,仍会作为通用词汇长期存在。