MMMU(大规模多学科多模态理解与推理基准)是一个用于评估多模态大语言模型在需要大学水平学科知识和审慎推理的任务上表现的基准。该基准于2023年11月发布,由俄亥俄州立大学的岳翔领导的22人研究团队与滑铁卢大学的陈文虎共同创建。该基准在CVPR 2024上以口头报告形式展示,此后已成为前沿多模态模型的标准评估工具。
该基准包含11,500道从大学考试、测验和教科书中人工收集的多模态题目。这些题目涵盖六个学科,,艺术与设计、商业、科学、健康与医学、人文与社会科学、以及技术与工程,,覆盖30个科目和183个子领域。题目包含高度异质的图像类型,包括图表、示意图、地图、表格、乐谱和化学结构式,旨在测试超越常识性视觉理解的专家级感知、知识和推理能力。
设计与目的
MMMU旨在弥补现有多模态基准的不足,这些基准通常侧重于基础视觉问答或常识推理。创建者旨在构建一个需要深度领域知识和多步推理的基准,类似于大学生解决本专业问题所需的能力。每道题目包含一张(或多张)图像和一段文本提示,并配有选择题答案。图像并非装饰性元素,而是解决问题的关键部分,要求模型准确提取和解读视觉信息。
该基准的难度体现在模型发布时的表现上。当时表现最好的模型准确率仅约为56%,远低于人类专家76%至89%的水平。这一差距凸显了当代多模态模型在处理复杂、知识密集型任务方面的局限性。
学科与科目
六个学科覆盖了广泛的学术领域。艺术与设计包括绘画、雕塑和平面设计等科目。商业涵盖金融、市场营销和管理。科学包括物理、化学和生物学。健康与医学涵盖解剖学、药理学和临床推理。人文与社会科学包括历史、哲学和经济学。技术与工程涵盖计算机科学、电气工程和机械工程。每个科目进一步细分为子领域,确保对大学课程体系的全面覆盖。
题目来源于真实的教材材料,如考试和教科书,这确保了题目能够反映对大学生所期望的知识类型和推理能力。包含多样化的图像类型(如乐谱和化学结构式)增加了额外的复杂性,因为模型必须精通解读专业化的视觉格式。
评估与影响
自发布以来,MMMU已成为前沿多模态模型的标准评估工具。GPT-4o、Gemini和Qwen-VL等系统的技术报告中均常规报告其在MMMU上的得分。该基准已被用于追踪多模态理解的进展,模型准确率随时间逐步提升。然而,截至2025年,即使是最先进的模型仍低于人类专家的表现,这表明在实现专家级多模态推理方面仍存在重大挑战。
该基准也影响了其他评估套件的开发,研究人员认识到需要更具挑战性和知识密集型的基准。MMMU对大学水平知识和审慎推理的强调,为评估多模态模型在大语言模型多模态场景中的能力树立了新标准。
局限性与批评
尽管被广泛采用,MMMU也面临一些批评。一些研究人员认为,选择题格式可能无法完全反映现实世界推理的开放性。另一些人指出,该基准侧重于大学水平知识,可能无法代表多模态模型的所有实际应用场景。此外,人工收集过程虽然保证了质量,但与自动生成的基准相比,限制了数据集的规模。
尽管如此,MMMU仍是评估当前多模态模型能力上限的宝贵工具。其设计启发了基准开发领域的进一步研究,推动该领域朝着更严格、更全面的评估方法发展。