MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark) est un benchmark conçu pour évaluer les grands modèles de langage multimodaux sur des tâches nécessitant des connaissances de niveau universitaire et un raisonnement délibéré. Publié en novembre 2023, il a été créé par une équipe de 22 chercheurs dirigée par Xiang Yue à l'Université d'État de l'Ohio et Wenhu Chen à l'Université de Waterloo. Le benchmark a été présenté comme un article oral à CVPR 2024 et est depuis devenu une évaluation standard pour les modèles multimodaux de pointe.
Le benchmark comprend 11,5 mille questions multimodales collectées manuellement à partir d'examens, de quiz et de manuels universitaires. Ces questions couvrent six disciplines - Art & Design, Business, Science, Health & Medicine, Humanities & Social Science, et Tech & Engineering - englobant 30 sujets et 183 sous-domaines. Les questions intègrent des types d'images très hétérogènes, notamment des graphiques, des diagrammes, des cartes, des tableaux, des partitions musicales et des structures chimiques, conçues pour tester la perception, les connaissances et le raisonnement de niveau expert, au-delà de la compréhension visuelle de sens commun.
Conception et Objectif
MMMU a été conçu pour combler une lacune dans les benchmarks multimodaux existants, qui se concentraient souvent sur la réponse à des questions visuelles de base ou le raisonnement de sens commun. Les créateurs visaient à élaborer un benchmark exigeant des connaissances approfondies spécifiques au domaine et un raisonnement en plusieurs étapes, semblable à ce qu'un étudiant universitaire devrait résoudre dans sa spécialité. Chaque question comprend une image (ou plusieurs images) et un texte d'invite, avec des réponses à choix multiples. Les images ne sont pas simplement décoratives ; elles sont essentielles à la résolution du problème, obligeant le modèle à extraire et interpréter avec précision les informations visuelles.
La difficulté du benchmark se reflète dans les performances des modèles au moment de sa publication. Les modèles les plus performants atteignaient seulement environ 56 % de précision, bien en dessous de la plage experte humaine de 76 à 89 %. Cet écart a mis en évidence les limites des modèles multimodaux contemporains face à des tâches complexes et intensives en connaissances.
Disciplines et Sujets
Les six disciplines couvrent un large éventail de domaines académiques. Art & Design inclut des sujets comme la peinture, la sculpture et le design graphique. Business couvre la finance, le marketing et la gestion. Science inclut la physique, la chimie et la biologie. Health & Medicine inclut l'anatomie, la pharmacologie et le raisonnement clinique. Humanities & Social Science inclut l'histoire, la philosophie et l'économie. Tech & Engineering inclut l'informatique, le génie électrique et le génie mécanique. Chaque sujet est ensuite divisé en sous-domaines, garantissant une couverture complète des programmes universitaires.
Les questions proviennent de matériels éducatifs réels, tels que des examens et des manuels, ce qui garantit qu'elles reflètent le type de connaissances et de raisonnement attendu des étudiants universitaires. L'inclusion de types d'images diversifiés, comme des partitions musicales et des structures chimiques, ajoute une couche de complexité supplémentaire, car les modèles doivent être compétents pour interpréter des formats visuels spécialisés.
Évaluation et Impact
Depuis sa publication, MMMU est devenu une évaluation standard pour les modèles multimodaux de pointe. Les scores sur MMMU sont régulièrement rapportés dans les rapports techniques de systèmes tels que GPT-4o, Gemini et Qwen-VL. Le benchmark a été utilisé pour suivre les progrès en compréhension multimodale, les modèles améliorant progressivement leur précision au fil du temps. Cependant, même les modèles les plus avancés en 2025 restent en deçà des performances expertes humaines, indiquant que des défis significatifs subsistent pour atteindre un raisonnement multimodal de niveau expert.
Le benchmark a également influencé le développement d'autres suites d'évaluation, car les chercheurs reconnaissent le besoin de benchmarks plus exigeants et intensifs en connaissances. L'accent mis par MMMU sur les connaissances de niveau universitaire et le raisonnement délibéré a établi une nouvelle norme pour évaluer les capacités des grands modèles de langage dans des contextes multimodaux.
Limites et Critiques
Malgré son adoption généralisée, MMMU a fait face à certaines critiques. Certains chercheurs soutiennent que le format à choix multiples ne capture pas pleinement la nature ouverte du raisonnement dans le monde réel. D'autres notent que l'accent mis sur les connaissances de niveau universitaire peut ne pas être représentatif de toutes les applications pratiques des modèles multimodaux. De plus, le processus de collecte manuelle, bien qu'il garantisse la qualité, limite la taille de l'ensemble de données par rapport aux benchmarks générés automatiquement.
Néanmoins, MMMU reste un outil précieux pour évaluer les limites supérieures des modèles multimodaux actuels. Sa conception a inspiré des recherches supplémentaires sur le développement de benchmarks, poussant le domaine vers des méthodes d'évaluation plus rigoureuses et complètes.