MMMU 2025.7 是 2025 年发布的第七次更新,针对大规模多学科多模态理解(MMMU)基准,这是一套广泛用于评估人工智能系统的测试集。该基准旨在测试大型语言模型及其他多模态模型在大学学术背景下对图像和文本进行推理的能力。2025 年系列中的每次更新都会引入新问题、修订评分协议或刷新参考答案,以跟上生成式人工智能系统的快速进步。
MMMU 基准最初是为了弥补评估领域的空白而创建的:许多现有测试要么侧重于纯文本推理,要么侧重于简单的图像分类。MMMU 要求模型将视觉信息与复杂的、特定领域的知识相结合,涵盖艺术、工程、医学和社会科学等学科。2025.7 更新延续了这一传统,特别强调需要多步推理以及从多个视觉元素中综合信息的问题。
基准结构
MMMU 2025.7 保留了其前身的核心结构。它由选自大学水平教科书和讲座材料的多选题组成。每个问题都包含一个图像或图表,这些图像或图表对于得出正确答案至关重要。问题按学科和所需推理类型(如基本识别、逻辑演绎或定量分析)进行分类。
2025.7 更新在审查过程后引入了一套修订后的参考答案,该过程识别出早期版本中的歧义。此次修订是持续努力的一部分,旨在确保基准仍然是衡量模型能力的可靠指标。该更新还扩大了工程和计算机科学类别中的问题池,反映了这些领域在多模态研究中的日益重要性。
评估方法
模型在 MMMU 2025.7 上使用标准化协议进行评估。每个模型都会收到完整的问题集,其回答将与参考答案进行比较。性能通常以总体准确率分数报告,并按学科和推理类型进行细分。这种细粒度的报告使研究人员能够识别模型在多模态理解方面的具体优势和劣势。
在 2025.7 更新中,评估协议进行了调整,以考虑使用思维链推理的模型。评分现在区分模型的最终答案和其中间推理步骤,尽管只有最终答案决定准确率分数。这一变化旨在鼓励开发能够解释其推理过程的模型,同时不惩罚那些不这样做的模型。
性能趋势
自最初的 MMMU 基准发布以来,领先模型的性能已大幅提升。2025.7 更新反映了一个格局,其中表现最佳的系统(通常基于带有多头注意力机制的Transformer架构)达到了几年前被认为无法企及的准确率水平。然而,该基准继续暴露出显著差距,特别是在需要细粒度视觉细节或专门领域知识的问题上。
MMMU 2025.7 上的显著结果来自诸如OpenAI、Anthropic和Google DeepMind等组织开发的模型。这些系统通常采用大规模深度学习技术,包括残差网络组件和高级损失函数。该基准也已被用于评估开放权重模型,提供了生态系统的比较视图。
影响与批评
MMMU 2025.7 已成为机器学习领域研究人员和开发者的参考点。其结果在技术报告和学术论文中频繁被引用,并且经常被包含在跟踪多个基准进展的排行榜中。该更新对大学水平内容的关注使其区别于依赖更简单的、众包问题的基准。
批评者指出,基准饱和是一个令人担忧的问题。随着模型的改进,固定问题集的边际价值会降低。2025.7 更新通过引入新问题和修订现有问题来解决这一问题,但一些研究人员认为,该基准还应纳入动态生成或对抗性示例。其他人指出,在 MMMU 上的高准确率并不一定转化为稳健的现实世界性能,这是大多数静态评估套件共有的局限性。
未来方向
MMMU 基准系列预计将继续发展。未来的更新可能会纳入基于视频的问题、交互式任务或对推理过程的更细致评估。该基准的维护者表示,他们正在探索减少数据污染风险的方法,即模型在泄漏到公共数据集中的基准问题上进行训练。2025.7 更新包含一小部分未公开发布的保留问题,旨在作为污染检查。
随着神经网络架构和训练方法的进步,像 MMMU 2025.7 这样的基准将继续成为衡量进展的重要工具。它们提供了一种比较系统的通用语言,并用于识别该领域必须应对的下一个挑战。