译自英文

MMMU 2025是一个用于评估多模态AI模型在大学水平、多学科任务上表现的基准,于2025年推出,旨在测试模型在多个学科中的感知、知识和推理能力。

MMMU 2025是一个旨在评估多模态人工智能系统能力的基准测试,特别是具备视觉理解能力的大型语言模型。它扩展了最初于2023年底由阿尔伯塔大学和卡尔顿大学等机构的研究人员联合发布的原始MMMU(大规模多学科多模态理解)基准。2025年版更新了该基准,以反映Generative AILarge language model研究的快速进展,引入了新任务和更具挑战性的问题,这些问题需要跨多个学科的深度推理。

该基准评估模型感知和推理视觉信息(如图像、图表和曲线图)并结合文本问题的能力。它涵盖广泛的学科,包括人文学科、社会科学、STEM领域以及医学和法律等专业领域。MMMU 2025旨在成为大学水平理解的严格测试,要求模型不仅识别视觉元素,还要应用领域特定知识和多步推理。该基准已成为比较来自OpenAIAnthropicGoogle DeepMind等组织领先AI系统性能的标准参考点。

任务设计与评估

MMMU 2025由多项选择题组成,每个问题配有一张或一组图像。问题的设计要求综合视觉线索和文本上下文,通常需要超越简单模式识别的知识。例如,一个问题可能展示电路图并询问元件变化的影响,或展示一幅历史画作并询问其文化意义。该基准包含超过30,000个问题,涵盖30个学科,重点在于对当前模型具有挑战性的问题。

评估以准确率作为主要指标,要求模型从一组选项中选择一个正确答案。该基准还按学科和问题类型跟踪性能,使研究人员能够识别具体的优势和劣势。在2025年版中,新增了一个问题子集,要求模型同时推理多张图像,测试它们比较和对比视觉信息的能力。这一设计推动模型超越简单的图像描述,进入视觉推理和问题解决领域。

关键发现与模型性能

截至2025年初,MMMU 2025上表现最佳的模型准确率得分在中80%范围内,相比原始MMMU中顶级模型约50-60%的得分有显著提升。这一进展归因于Transformer (architecture)架构的进步、更大的训练数据集以及改进的训练技术,如Reinforcement Learning from AI Feedback (RLAIF)Curriculum Learning。值得注意的是,来自OpenAIGoogle DeepMind的模型持续位居排行榜前列,其最新版本在物理和生物学等某些学科上表现出接近人类水平的性能。

然而,该基准揭示了持续存在的差距。模型在需要抽象推理、常识知识或理解复杂空间关系的问题上仍然存在困难。性能在不同学科间也差异显著,人文学科和社会科学通常比纯STEM领域更难。该基准的创建者强调,MMMU 2025并非已解决的问题,它继续作为研究动力,推动Multi-Head AttentionCross-Attention机制等领域的发展,以更好地整合视觉和文本信息。

与其他基准的比较

MMMU 2025是更广泛的AI评估基准生态系统的一部分。它补充了其他知名测试,如视觉问答(VQA)基准和通用语言理解评估(GLUE)套件。与侧重于日常场景简单问题的VQA不同,MMMU 2025针对大学水平的学术内容,使其更符合开发能够辅助教育和专业工作的AI目标。与GLUE等纯文本基准相比,MMMU 2025增加了视觉理解这一关键维度,这对于自动驾驶、医学成像和机器人技术等应用至关重要。

该基准也不同于较新的多模态基准,如大规模多任务语言理解(MMLU),因为MMMU 2025要求每个问题都有视觉输入,而MMLU是纯文本的。这使得MMMU 2025成为更直接测试模型处理现实世界数据(通常是多模态的)能力的工具。研究人员通常将MMMU 2025与其他基准结合使用,以全面了解模型的能力,因为没有任何单一基准能捕捉智能的所有方面。

影响与未来方向

MMMU 2025的引入对Artificial intelligence领域产生了重大影响。它推动了更稳健的视觉编码器、更好的视觉和文本特征融合以及更高效训练方法的研究。AMDIntelTSMC等公司也对此关注,因为该基准的计算需求凸显了使用AWS TrainiumGroq加速器等专用硬件高效运行这些模型的必要性。

展望未来,MMMU 2025的创建者计划发布包含更具挑战性问题的新版本,包括要求模型生成解释而非仅选择答案的开放式任务。还有讨论将视频和音频模态纳入其中,这将进一步推动多模态理解的边界。随着AI模型的不断改进,像MMMU 2025这样的基准将在衡量进展和识别人类水平智能仍无法企及的领域方面发挥关键作用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·multimodal·evaluation·ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史