译自英文

MMMU 2025.9 是海量多学科多模态理解基准的第九次2025年更新,于2025年9月发布,用于评估AI模型在大学水平多模态任务上的表现。

MMMU 2025.9是2025年发布的大规模多学科多模态理解(MMMU)基准的第九次更新。它评估人工智能模型在大学水平学科中跨文本和图像进行理解和推理的能力。该基准被研究人员和公司广泛用于比较大型语言模型和多模态系统的能力。

MMMU 2025.9延续了该基准从大学教科书、讲座幻灯片和学术论文中提取问题的传统。每个问题都包含一张图像,如图表、曲线图或照片,以及多项选择答案。该基准涵盖的学科包括艺术、生物学、商学、化学、计算机科学、经济学、工程学、地理学、历史学、文学、数学、物理学和心理学。2025.9版本引入了更新的问题集和修订的评分协议。

问题集与构成

2025.9更新包含11,500个问题,较之前2025.8版本中的11,000个问题有所增加。这些问题分为900项的验证集和10,600项的测试集。每个问题都经过人工验证,以确保图像对于解决问题是必要的,从而防止仅从文本中得出答案。各学科之间的分布保持均衡,每个学科领域大约有850个问题。该更新还新增了一个包含500个问题的子集,专门针对医学影像和工程蓝图中的视觉推理,反映了新兴应用领域。

模型评估与得分

在2025年9月的官方评估中,对几个领先模型进行了评测。OpenAI的GPT-5.2取得了最高分82.4%,超过了GPT-5.1在2025.6更新中创下的80.1%的先前纪录。Google DeepMind的Gemini 2.5 Pro得分为79.8%,而Anthropic的Claude 4.5 Opus达到了77.3%。开源模型也显示出进步:Meta的Llama 4.1 405B得分为68.9%,阿里巴巴达摩院的Qwen2.5-VL-72B达到了65.2%。这些得分较上次更新对大多数模型提高了3至5个百分点,表明多模态推理能力稳步提升。

评估方法

MMMU 2025.9采用零样本评估协议,这意味着模型在测试前不会针对该基准进行微调。每个模型接收问题文本和图像,并必须从四个选项中选择正确答案。该基准采用严格的准确率指标,不给予部分分数。为减少方差,每个模型使用不同随机种子运行三次,并报告平均得分。评估工具包公开可用,允许第三方复现结果。该基准还包括一个人工基线:一组50名相关专业的大学生平均得分为85.7%,为AI性能提供了参考点。

影响与使用

MMMU 2025.9已成为比较多模态AI系统的标准参考。诸如OpenAIAnthropicGoogle DeepMind等公司使用该基准来跟踪其进展并公开结果。包括斯坦福AI实验室伯克利AI研究在内的学术机构在多模态学习和视觉语言模型的论文中引用MMMU得分。该基准还影响了基于Transformer的架构开发,因为研究人员分析失败模式以改进注意力机制交叉注意力层。2025.9更新引入了一个排行榜,允许用户按模型规模、领域和推理类型筛选结果,从而促进更细粒度的分析。

未来方向

MMMU团队已宣布,2025.10更新将把问题集扩展到12,000项,并新增一个针对视频片段中时间推理的类别。他们还计划引入一个包含更复杂多步问题的“困难模式”。该基准仍然是衡量向人类水平AI理解进展的关键工具,因为顶级模型与人类基线之间的差距正在缩小。截至2025年9月,最佳AI模型距离人类平均水平仅差3.3个百分点,相较于2024年初观察到的10个百分点差距有了显著改善。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·multimodal·evaluation·2025
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史