MMMU 2025.5 是大型多学科多模态理解(MMMU)基准在 2025 年发布的第五次更新,该基准是一套广泛使用的 人工智能 系统评估套件。该基准评估 大型语言模型 及相关模型在需要视觉和文本理解的学科中执行大学水平推理的能力。MMMU 2025.5 延续了该基准定期刷新迭代的传统,引入了一组新的问题和修订后的评分流程,以缓解饱和效应并更好地区分最先进系统之间的差异。
最初的 MMMU 基准于 2023 年由一个学术和工业研究人员联盟引入,包括来自 斯坦福人工智能实验室、卡内基梅隆大学 和 多伦多大学 的团队。它包含来自 30 个学科(包括艺术、工程和医学)的教科书、讲义幻灯片和考试试卷中的问题。每个问题将图像(如图表、曲线图或照片)与多项选择或开放式提示相结合,要求模型在两种模态上进行基于 多头注意力 的推理。该基准的难度在于其对领域特定知识和精确视觉解释的需求,这使其有别于更简单的 机器学习 基准。
MMMU 2025.5 特别针对 2025 年所见的快速进展,当时早期的 2025 版本(MMMU 2025.1 至 2025.4)对领先模型而言已变得越来越容易。此次更新新增了约 1200 个问题,由来自 牛津大学 和 麻省理工学院计算机科学与人工智能实验室 等机构的 50 位专家标注员小组策划。这些问题强调多步推理、反事实情景以及细微的视觉差异,例如区分相似的解剖结构或解读复杂的电路图。更新还引入了一种新的评分规则,对过度自信的错误答案进行惩罚,鼓励模型输出中的校准 温度缩放。
基准设计与更新
MMMU 套件分为六个广泛学科:艺术与设计、商业、科学、健康与医学、人文与社会科学以及技术与工程。每个学科包含多个主题,问题根据人类表现标注难度级别(简单、中等、困难)。MMMU 2025.5 保留了这一结构,但重新平衡了分布:它将困难问题的比例从 35% 增加到 45%,以反映挑战已掌握较简单项目的模型的需要。更新还引入了一个新的“视觉扰动”子集,其中图像被轻微旋转、裁剪或颜色偏移,测试对输入变化的鲁棒性。
MMMU 2025.5 的一个关键创新是纳入了“对抗性协作”问题,这些问题的开发得到了 谷歌深度思维 和 开放人工智能 研究人员的参与。这些问题设计为具有歧义或需要图像中未呈现的外部知识,迫使模型要么请求澄清,要么表明不确定性。这与 生成式人工智能 评估的更广泛趋势一致,在该趋势下,基准不仅衡量准确性,还越来越注重衡量推理透明度和失败模式。
评估方法
模型在零样本设置中进行评估,这意味着它们不会收到任何 MMMU 问题的先前示例。该基准使用包括图像和文本指令的标准化提示格式,模型必须生成一个响应,以解析出最终答案。对于多项选择题,模型的输出与正确选项进行匹配;对于开放式问题,采用精确匹配和语义相似度(使用基于 变换器 的嵌入)相结合的方式。MMMU 2025.5 还分别报告了使用外部工具(如 亚马逊网络服务 或 谷歌云 API)的模型的性能,尽管为保持可比性并不鼓励此类使用。
MMMU 2025.5 中的评分引入了“置信度加权准确性”指标。对于每个问题,模型必须输出置信度分数(0 到 1)。最终分数是正确回答按置信度加权的平均值,并对高置信度错误进行惩罚。此指标旨在捕捉校准特性,这对于 直觉外科 机器人或 威摩 自动驾驶等领域的现实部署至关重要,因为在这些领域,过度自信的错误可能代价高昂。
性能趋势
截至 MMMU 2025.5 发布,来自 安思罗比克、开放人工智能 和 谷歌深度思维 的领先模型准确率在 78% 至 82% 范围内,高于 MMMU 2025.1 的约 70%。然而,新的置信度加权指标将这些分数降低至 65% 至 70%,突显许多模型校准不佳。较小的模型,例如由 高通 或 安谋控股 为边缘设备优化的模型,通常得分低 20 到 30 个百分点,凸显了前沿系统与部署系统之间的差距。
该基准也揭示了空间推理和领域特定术语方面的持续弱点。例如,模型常混淆医学影像中的左右方向,并误识别有机化学问题中的化学结构。这些发现推动了针对这些缺陷的 课程学习 和 数据增强 技术的研究。
影响与反响
MMMU 2025.5 已被主要 AI 实验室作为内部评估检查点采用。开放人工智能 和 安思罗比克 在模型发布说明中公开引用了 MMMU 分数,谷歌深度思维 则使用该基准来指导视觉任务中 残差网络 和 U-Net 架构的训练。该基准的更新也被学术研究人员用于研究 深度学习 模型的泛化,来自 伯克利人工智能研究 和 巴巴原子研究中心 的论文分析了错误模式。
批评者指出,MMMU 对英语、西方中心教育材料的依赖可能引入文化偏见,这一担忧得到了 阿里巴巴达摩院 和 日本电气 研究人员的回应。对此,MMMU 团队宣布计划在 2025 年底进行多语言扩展,但细节尚未确认。尽管存在这些局限性,MMMU 2025.5 仍然是多模态推理的标准参考,补充了用于战略思维的 国际象棋计算机 评估等其他基准。
未来方向
由来自 斯坦福人工智能实验室 和 多伦多大学 的首席研究员领导的 MMMU 团队,概述了 2026 年的路线图。计划中的更新包括使用 生成式人工智能 模型进行动态问题生成,这将为每次评估运行创建独特问题,以及集成基于视频的任务。该团队还在探索与 诺基亚贝尔实验室 和 施乐帕洛阿尔托研究中心 的合作,为工业环境(如质量控制和遥感)中的多模态系统开发基准。
随着 人工智能 系统能力的增强,像 MMMU 2025.5 这样的基准在确保进展可衡量和有意义方面发挥着关键作用。此次更新对校准和鲁棒性的强调反映了该领域的成熟,超越了原始准确性,转向对模型行为更细致的评估。对于从业者而言,MMMU 2025.5 提供了一个严格的测试平台,用于比较模型和指导开发优先级。