译自英文

MMMU 2025.1是“大规模多学科多模态理解”基准测试的2025年首次更新,引入了新任务并修订了多模态AI系统的评估协议。

MMMU 2025.1 是 2025 年大规模多学科多模态理解基准的首次更新。它扩展了原始 MMMU 框架,该框架旨在评估需要视觉感知和领域特定推理的 人工智能 系统。此次更新引入了新的问题格式、更多学科以及修订的评分协议,以更好地反映现代 大型语言模型 和多模态模型的能力。

该基准仍然是从事结合视觉和语言的 深度学习 系统研究人员和开发者的关键参考。通过提供一套标准化的挑战,MMMU 2025.1 有助于比较不同模型的性能,包括基于 Transformer 架构和 神经网络 设计的模型。

基准结构

MMMU 2025.1 保留了原始基准的核心结构,其中包括来自大学水平教科书和讲义的选择题。此次更新新增了一类需要跨图像和文本进行多步推理的问题,从而增加了仅依赖 生成式人工智能 技术的模型的难度。该基准涵盖物理、化学、医学和工程等学科,每个问题都配有一张或多张对正确回答至关重要的图像。

2025.1 版本还引入了修订后的评分系统,该系统更严厉地惩罚自信但错误的答案,鼓励模型校准其不确定性。这一变化与 机器学习 评估的近期趋势一致,其中校准被认为与原始准确性同等重要。

评估协议

模型在零样本基础上进行评估,这意味着在测试前不会对 MMMU 数据进行微调。该协议确保性能反映模型的通用推理能力,而非记忆能力。基准包括用于开发的验证集和用于最终评分的测试集,结果以准确率百分比报告。

对于 2025.1 更新,评估流程已自动化,以处理更大的模型输出,包括来自 OpenAI 的 GPT-4o 和 Anthropic 的 Claude 3.5 Sonnet,这些是最早测试的模型之一。该协议还支持来自 Google DeepMind 和其他领先实验室的模型,确保广泛适用性。

与先前版本的主要变化

MMMU 2025.1 的一个主要变化是包含了需要时间推理的问题,其中图像序列中事件的顺序很重要。这一新增测试了模型理解动态场景的能力,这种能力对于 Waymo 的自动驾驶和 特斯拉自动驾驶 等应用至关重要。

另一个变化是视觉输入类型的扩展。除了静态照片和图表外,基准现在还包括图表、图形和软件界面的截图。这种多样性挑战模型从各种视觉格式中提取信息,这一任务对许多 深度学习 系统来说仍然困难。

此次更新还引入了一个新的问题子集,需要跨模态推理,其中答案取决于结合图像和随附文本中的信息。该子集旨在测试视觉和语言理解的整合,这是现代 Transformer 中 多头注意力 机制的核心目标。

性能趋势

MMMU 2025.1 的早期结果显示,领先模型的准确率超过 70%,但人类表现(约 90%)与最佳人工智能系统之间仍存在显著差距。使用 思维链 提示或类似推理技术的模型往往表现更好,这表明显式推理步骤有助于处理复杂的多模态任务。

然而,基准也揭示了当前模型的持续弱点,特别是在需要精确空间推理或理解细微视觉细节的任务中。例如,涉及医学成像或工程图表的问题常常难倒最先进的系统,凸显了在 计算机视觉 和多模态学习方面进一步研究的必要性。

对人工智能发展的影响

MMMU 2025.1 的发布对更广泛的人工智能社区具有影响。它为评估多模态理解的进展提供了一个严格的测试平台,这对于开发能在现实环境中运行的人工智能系统至关重要。像 亚马逊网络服务谷歌云 这样的公司正在使用该基准来评估自己的模型,并指导其人工智能服务的改进。

斯坦福人工智能实验室伯克利人工智能研究 等机构的研究人员已将 MMMU 2025.1 引用为研究当前模型局限性的宝贵资源。该基准还作为 模型剪枝数据增强 新技术的新基准,因为开发者寻求在不牺牲准确性的情况下提高效率。

总体而言,MMMU 2025.1 代表了多模态人工智能评估向前迈出的一步,推动该领域朝着更强大、更有能力的系统发展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·multimodal·evaluation·artificial-intelligence
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史