अंग्रेज़ी से अनुवादित

MMMU नवंबर 2023 का एक बेंचमार्क है, जो छह विषयों में कॉलेज-स्तर, विशेषज्ञ तर्क कार्यों पर मल्टीमॉडल बड़े भाषा मॉडलों का मूल्यांकन करने के लिए 11.5K मैन्युअल रूप से एकत्रित प्रश्नों का उपयोग करता है। यह अग्रणी AI प्रणालियों के लिए एक मानक मूल्यांकन उपकरण बन गया है।

MMMU(大规模多学科多模态理解与推理基准)是一个用于评估多模态大语言模型的基准,其任务要求大学水平的学科知识和深思熟虑的推理能力。该基准于2023年11月发布,旨在测试超越常识性视觉理解的专家级感知、知识和推理,其问题从大学考试、测验和教科书中手动收集而来。

该基准包含1.15万个多模态问题,涵盖六个学科:艺术与设计、商业、科学、健康与医学、人文与社会科学以及技术与工程。这些问题覆盖30个科目和183个子领域,包含高度异质的图像类型,如图表、示意图、地图、表格、乐谱和化学结构。在发布时,表现最佳的模型仅达到约56%的准确率,远低于人类专家76–89%的范围,凸显了该基准的难度。

开发与发布

MMMU由俄亥俄州立大学的Xiang Yue和滑铁卢大学的Wenhu Chen领导的22人研究团队开发。团队手动收集和整理问题,以确保它们真正需要大学水平的知识和多步推理,而非简单的模式识别。该基准在2024年CVPR(顶级计算机视觉会议)上作为口头报告论文展示,标志着其在领域内的重要性。

基准设计

MMMU中的问题设计为多模态,即结合文本与各种图像类型。这种异质性是有意为之,因为它迫使模型整合来自不同来源的视觉信息,从科学图表到艺术构图。该基准强调深思熟虑的推理,要求模型应用特定学科的知识和逻辑步骤来得出答案,而非依赖表面线索。

影响与采用

自发布以来,MMMU已成为前沿多模态模型的标准评估工具。MMMU的得分经常出现在诸如GPT-4o、Gemini和Qwen-VL等系统的技术报告中。该基准的难度推动了多模态人工智能的进步,促使开发者提升模型的专家级感知和推理能力。其广泛使用反映了机器学习领域向更严格、更领域特定评估指标发展的更广泛趋势。

相关基准与背景

MMMU位于评估大语言模型和多模态系统的基准体系中。早期基准侧重于一般知识或简单视觉任务,而MMMU则针对大学级专业知识和异质图像理解。这与OpenAI、Anthropic和Google DeepMind等组织开发能处理复杂现实世界问题的模型的努力相一致。该基准对深思熟虑推理的强调也与深度学习和神经网络的研究相关,特别是在变换器和多头注意力等领域。

局限性与未来方向

尽管取得了成功,MMMU仍存在局限性。手动收集过程劳动密集,且基准的静态特性可能随着模型改进而趋于饱和。研究人员指出,MMMU上的高分并不一定转化为动态现实环境中的稳健表现。未来的基准可能需要纳入更自适应或生成式的评估方法,在MMMU的基础上应对这些挑战。

参考文献

  • Yue, X., et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. arXiv预印本。
  • CVPR 2024口头报告。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास