译自英文

AI基准测试是一种标准化的数据集和任务,用于衡量和比较AI模型的性能,构成能力进步量化的主要方式,尽管基准测试面临饱和与数据污染等反复出现的问题。

AI基准测试是一种标准化的数据集、任务或任务套件,用于衡量和比较AI系统的性能,提供一个共同的衡量标准,使研究人员和公众能够跨实验室、跨时间比较模型。自ImageNet竞赛以来,基准测试在AI进展中发挥了核心作用,该竞赛帮助催化了深度学习时代,并且至今仍是LLM评估中使用的主要工具。

基准测试的类型

基准测试因衡量对象的不同而差异很大。知识和推理基准测试,如MMLU,测试跨学科领域的广泛事实和推理能力。编程基准测试,如HumanEvalSWE-bench,衡量模型编写或修复代码的能力。抽象推理基准测试,如ARC-AGI,旨在通过测试新颖的谜题解决而非回忆来抵抗记忆化。多模态基准测试测试图像或视频理解能力,而安全基准测试则探测有害输出、越狱易感性或偏见。除了静态数据集之外,人类偏好平台(如LMArena)通过众包的成对比较而非固定测试集来对模型进行排名。

饱和

一个反复出现的模式是基准测试饱和:随着模型的改进,给定基准测试上的性能趋向于天花板,通常超过校准良好的人类表现,此时该基准测试不再能有效区分不同模型。MMLU于2020年推出,几年内领先模型的准确率就超过了90%,促使了更难的后继基准测试的出现。这一循环,,基准测试被引入、广泛采用、饱和、然后被替换,,几乎在每个主要能力领域都反复发生,这也是基准测试套件频繁更新或补充更难变体的原因之一。

污染

一个相关且严重的问题是数据污染:由于大型语言模型在互联网的大规模抓取数据(包括Common Crawl)上进行训练,基准测试的问题和答案可能直接或通过在线讨论基准测试的方式泄漏到训练数据中,从而虚增模型的测量性能,而不反映真实能力。检测污染是困难的,一些基准测试(包括ARC-AGI)专门设计为通过新颖的问题生成来抵抗污染。污染问题使得该领域的一些人对实验室未经独立验证而自行报告的基准测试分数持怀疑态度。

其他批评

基准测试也可能被直接博弈或优化,这是更广泛开发过程中的一种奖励黑客形式,即实验室针对热门基准测试调优模型,而在实际用途上没有相应的提升。静态基准测试也可能无法捕捉与真实使用相关的智能体、多步骤或长时程能力,这推动了向更动态和基于任务的评估转变,包括SWE-bench使用真实的GitHub问题,以及向在更难的保留问题集上评估的、依赖测试时计算推理模型转变。

在该领域的角色

尽管存在局限性,基准测试仍然是AI进展报告、营销和辩论的核心方式,几乎出现在每个模型发布公告以及关于能力阈值的政策讨论中。其局限性推动了对互补评估方法的日益增长的兴趣,包括人类偏好平台、LLM作为评判者的方法,以及更狭窄、由专家策划的、不易受污染和饱和影响的评估。

分类:ai-evaluation·industry
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史