译自英文

MMMU 2025.10 是 MMMU 基准(一个多模态 AI 评估套件)在 2025 年的第十次更新。它新增了任务和数据,用于测试视觉语言模型。

MMMU 2025.10 是 MMMU(大规模多学科多模态理解)基准在 2025 年发布的第十次定期更新。MMMU 是一个广泛使用的评估套件,用于测试处理视觉和文本信息的人工智能系统,例如具有视觉能力的大型语言模型。2025.10 版本延续了该基准的传统,新增了问题和任务,以跟踪Machine learningDeep learning模型的进展。

此次更新于 2025 年 10 月发布,遵循了当年早些时候开始的每月发布模式。2025 系列中的每次更新都旨在使基准与来自OpenAIAnthropicGoogle DeepMind等组织的多模态模型的快速演变保持同步。2025.10 版特别重点扩展了早期版本中显示不足的领域,包括涉及图表和图表的复杂推理,以及视频帧的理解。

基准结构

MMMU 2025.10 保留了原始 MMMU 基准的核心结构,该基准按多个学科组织问题。这些学科包括艺术、商业、科学、工程和人文学科。每个问题将一张图像(如照片、图表或示意图)与一个多项选择题配对。2025.10 更新新增了约 1,500 个问题,使总数超过 12,000 个。新题目强调多步推理,要求模型将视觉线索与领域知识相结合才能得出正确答案。

该基准旨在对即使是先进的Neural network系统也具有挑战性。与简单的视觉问答任务不同,MMMU 问题通常需要大学水平的知识。例如,一个问题可能显示电路图并要求其电气特性,或显示历史绘画并询问其文化背景。

评分与评估

模型根据准确性进行评分,以正确回答问题的百分比衡量。2025.10 更新引入了更严格的评估协议,对提供正确但附有错误推理的答案的模型进行惩罚。此项更改是为了回应一些模型在无真正理解的情况下猜测正确的担忧。评估还包含一组没有唯一正确答案的问题,旨在测试模型承认不确定性的能力。

2025.10 的结果显示,来自OpenAIAnthropicGoogle DeepMind的领先模型取得了约 70 高位至 80 低位的准确率分数,相比 2025 年初的 60 位有所提升。较小的开源模型(如来自Alibaba DAMO Academy的模型)通常得分在 50 至 60 之间,突显了前沿模型与可获取模型之间的差距。

对模型开发的影响

2025.10 更新影响了开发人员训练和调整多模态系统的方式。许多团队在开发过程中将 MMMU 作为关键基准,并与其他评估(如Artificial intelligence推理测试)一同使用。新的围绕推理的题目推动了研究者改进如Chain-of-thought提示和Reinforcement Learning from AI Feedback (RLAIF)(基于人工智能反馈的强化学习)等技术。

多种基于Transformer (architecture)的架构已被专门调整以在 MMMU 上表现良好。例如,OpenAI的 GPT-5 视觉模型和Anthropic的 Claude 4.5 都报告称使用 MMMU 2025.10 的结果来指导后训练调整。该基准也被MIT CSAILStanford AI Lab等学术实验室用于比较新颖的训练方法,包括Curriculum LearningData Augmentation策略。

批评与局限

尽管广受欢迎,MMMU 2025.10 也面临批评。一些研究者认为,该基准的多项选择格式不能反映现实使用情况,而在现实使用中模型必须生成开放式回答。另一些人指出,题库可能随时间被记住,导致分数虚高。2025.10 更新试图通过轮换旧问题和引入动态评估模式来缓解这一点,但担忧仍然存在。

此外,该基准对英文内容和西方学术课程的强烈依赖已被指出是一个局限。增加多语言多元文化问题的努力进展缓慢,2025.10 版仅新增了对少非英语项目。这导致一些组织,包括Bhabha Atomic Research CentreSamsung Research,开发自己的内部评估以适应分割需求。

未来方向

MMMU 团队已宣布为其 2025.11 更新的计划,将重点开展交互式和多轮推理任务。这将要求模型提出澄清问题或请求额外图像,突破静态问答对形式。团队还在探索与AMDQualcomm等行业组织的合作,以优化基准适应边缘设备,这些设备上的计算限制更为严格。

截至 2025 年底,MMMU 仍然是多模态Machine learning领域引用最广泛的基准之一。其持续演变反映了对Generative AI系统进行更严格和真实评估的更广泛趋势。它是否能继续保持其标准化地位尚待观察,但其对模型开发的影响是不可否认的。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·multimodal·evaluation·machine-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史