MMMU(大规模多学科多模态理解与推理基准)是一个用于评估多模态大语言模型的基准,其任务要求具备大学水平的学科知识和深思熟虑的推理能力。该基准于2023年11月发布,旨在测试专家级的感知、知识和推理,超越常识性的视觉理解,其问题由人工从大学考试、测验和教科书中收集而来。
该基准包含1.15万个多模态问题,涵盖六个学科:艺术与设计、商业、科学、健康与医学、人文与社会科学,以及技术与工程。这些问题覆盖30个科目和183个子领域,并包含高度异质的图像类型,如图表、示意图、地图、表格、乐谱和化学结构。在发布时,表现最佳的模型仅达到约56%的准确率,远低于人类专家76–89%的范围,这凸显了该基准的难度。
开发与发布
MMMU由俄亥俄州立大学的Xiang Yue和滑铁卢大学的Wenhu Chen领导的22名研究人员团队开发。团队人工收集并整理了问题,以确保其真正需要大学水平的知识和多步骤推理,而非简单的模式识别。该基准在2024年CVPR(顶级计算机视觉会议)上以口头报告形式发表,标志着其在该领域的重要性。
基准设计
MMMU中的问题设计为多模态,即文本与各种图像类型相结合。这种异质性是有意为之,因为它迫使模型整合来自不同来源的视觉信息,从科学图表到艺术构图。该基准强调深思熟虑的推理,要求模型应用特定学科的知识和逻辑步骤来得出答案,而非依赖表面线索。
影响与采用
自发布以来,MMMU已成为前沿多模态模型的标准评估工具。MMMU的分数经常出现在诸如GPT-4o、Gemini和Qwen-VL等系统的技术报告中。该基准的难度推动了多模态人工智能的进展,促使开发者提升模型的专家级感知和推理能力。其广泛使用反映了机器学习中向更严格、更特定领域评估指标发展的总体趋势。
相关基准与背景
MMMU处于旨在评估大语言模型和多模态系统的基准格局之中。早期基准侧重于一般知识或简单视觉任务,而MMMU则针对大学级专业知识和异质图像理解。这与OpenAI、Anthropic和Google DeepMind等组织开发能够处理复杂现实世界问题的模型的努力相一致。该基准对深思熟虑推理的强调也与深度学习和神经网络的研究相关,特别是在Transformer和多头注意力等领域。
局限性与未来方向
尽管取得了成功,MMMU仍存在局限性。人工收集过程劳动密集,且基准的静态性质可能导致随着模型改进而出现饱和。研究人员指出,MMMU上的高分并不一定转化为动态现实环境中的稳健表现。未来的基准可能需要纳入更具适应性或生成性的评估方法,在MMMU的基础上应对这些挑战。
参考文献
- Yue, X., et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. arXiv preprint.
- CVPR 2024口头报告。