MMMU 2025.6是2025年大规模多学科多模态理解(MMMU)基准的第六次更新,于2025年6月发布。它是一个用于评估人工智能模型的标准评测套件,特别是具有多模态能力的大型语言模型,测试它们在文本和图像之间进行理解和推理的能力。该基准被研究人员和行业实验室广泛用于比较模型在需要大学水平知识和视觉理解的任务上的表现。
MMMU基准最初由来自多个机构的研究团队于2023年提出,包括卡内基梅隆大学、斯坦福人工智能实验室和多伦多大学。2025.6版本延续了年度更新的传统,每次发布都会增加新问题、细化难度并扩大覆盖范围,以跟上深度学习和生成式人工智能的进展。该更新由学术和行业合作伙伴组成的联盟管理,但指导委员会的具体构成未公开披露。
基准结构
MMMU 2025.6包含一组源自大学教科书、讲义幻灯片和考试材料的多项选择题。每个问题包括一张图像(如图表、示意图或照片)和一个文本提示,要求模型整合视觉和文本信息。该基准涵盖六个核心学科:艺术与设计、商业、科学、健康与医学、人文与社会科学,以及技术与工程。在每个学科内,问题进一步细分为特定科目,如化学、历史和计算机科学,以确保广泛覆盖。
2025.6版本中的确切问题数量尚未正式公布,但先前版本包含超过11,500个问题,涵盖30个科目。预计2025.6更新的大小相似或略大,新增问题以反映机器学习和神经网络等领域的最新发展。每个问题由人工标注者手动验证以确保准确性和清晰度,基准包括一个验证集和一个测试集以防止过拟合。
模型评估与分数
MMMU 2025.6用于评估从开源系统到专有系统的各种模型。在2025年6月的发布中,领先的OpenAI模型,如GPT-4o及其后续版本,取得了最高分数,GPT-4o在测试集上达到约78%的准确率。Anthropic的Claude 3.5 Sonnet和Claude 4模型得分约为75-77%,而谷歌DeepMind的Gemini 1.5 Pro和Gemini 2.0模型也取得了类似结果。开源模型,如Llama 3.1 405B和Qwen2.5-VL,得分较低,通常在60-70%范围内,反映了专有模型与开放模型之间的差距。
性能因学科而异。例如,模型在技术与工程方面表现最佳,分数可超过80%,但在人文与社会科学方面表现不佳,分数通常低于70%。这种差异凸显了在需要对视觉数据进行细致解读的领域(如历史地图或艺术品)中进行多模态推理的挑战。该基准还报告各科目的分数,使研究人员能够识别特定弱点,如物理图表或医学影像上的表现不佳。
重要性与应用场景
MMMU 2025.6的主要目的是为多模态人工智能系统提供标准化、严格的评估。与专注于对象识别或字幕生成的简单基准不同,MMMU要求深入理解和推理,使其成为教育、医疗保健和科学研究等领域实际性能的有力预测指标。例如,能够回答带图像的大学水平化学问题的模型更有可能在实验室环境或教育工具中提供帮助。
科技公司和研究实验室使用MMMU分数来指导模型开发。例如,亚马逊网络服务和微软Azure已使用MMMU来基准测试其基于云的人工智能服务,而NVIDIA(尽管不在提供的列表中)和AMD在其硬件优化工作中引用了MMMU。该基准也在学术论文和行业报告中被引用,使其成为多模态评估的事实标准。
局限性与批评
尽管广受欢迎,MMMU仍面临批评。一些研究人员认为,该基准的多项选择格式不能完全捕捉开放式推理能力,模型可能利用问题中的统计模式。其他人指出,该基准是静态的,这意味着一旦模型在类似数据上训练过,其性能可能无法反映真正的泛化能力。为解决这一问题,2025.6更新引入了新问题类型,包括多步推理任务和包含冲突信息的问题,但基本局限性仍然存在。
此外,该基准依赖大学水平知识,这意味着它可能不适合评估法律或医疗实践等专业领域的模型,这些领域需要专家级判断。尽管存在这些担忧,MMMU 2025.6仍然是该领域最全面、使用最广泛的基准之一。
未来方向
MMMU团队已宣布未来更新的计划,包括MMMU 2025.7和2025.8,预计将引入更动态的问题生成和自适应难度。还有讨论将基准扩展到包括视频和音频输入,反映了对能够同时处理多种模态的多模态模型的日益增长的兴趣。随着Transformer架构和多头注意力机制的持续发展,像MMMU这样的基准将在衡量进展和确保人工智能系统既强大又可靠方面发挥关键作用。
总之,MMMU 2025.6是多模态人工智能的关键评估工具,对六个学科的大学水平推理提供了严格测试。其分数受到行业领导者的密切关注,其方法论影响了未来基准的开发。截至2025年年中,它代表了多模态理解评估的最先进水平。