MMMU 2025.9 est la neuvième mise à jour du benchmark Massive Multi-discipline Multimodal Understanding (MMMU) publié en 2025. Il évalue la capacité des modèles d'intelligence artificielle à comprendre et à raisonner sur des textes et des images dans des matières de niveau universitaire. Ce benchmark est largement utilisé par les chercheurs et les entreprises pour comparer les capacités des grands modèles de langage et des systèmes multimodaux.
MMMU 2025.9 poursuit la tradition du benchmark en présentant des questions issues de manuels universitaires, de diapositives de cours et d'articles académiques. Chaque question comprend une image, telle qu'un diagramme, un graphique ou une photographie, accompagnée de réponses à choix multiples. Le benchmark couvre des disciplines telles que l'art, la biologie, le commerce, la chimie, l'informatique, l'économie, l'ingénierie, la géographie, l'histoire, la littérature, les mathématiques, la physique et la psychologie. La version 2025.9 introduit un ensemble de questions actualisé et des protocoles de notation mis à jour.
Ensemble de questions et composition
La mise à jour 2025.9 contient 11 500 questions, soit une augmentation par rapport aux 11 000 questions de la version précédente 2025.8. Les questions sont réparties en un ensemble de validation de 900 éléments et un ensemble de test de 10 600 éléments. Chaque question est vérifiée manuellement pour garantir que l'image est nécessaire à la résolution du problème, empêchant ainsi que les réponses soient dérivées du texte seul. La répartition entre les disciplines reste équilibrée, avec environ 850 questions par domaine. La mise à jour inclut également un nouveau sous-ensemble de 500 questions ciblant spécifiquement le raisonnement visuel dans l'imagerie médicale et les plans d'ingénierie, reflétant des domaines d'application émergents.
Évaluation des modèles et scores
Lors de l'évaluation officielle de septembre 2025, plusieurs modèles de premier plan ont été évalués. Le GPT-5.2 d'OpenAI a obtenu le score le plus élevé de 82,4 %, dépassant le précédent record de 80,1 % établi par GPT-5.1 dans la mise à jour 2025.6. Le Gemini 2.5 Pro de Google DeepMind a obtenu 79,8 %, tandis que le Claude 4.5 Opus d'Anthropic a atteint 77,3 %. Les modèles open source ont également montré des progrès : le Llama 4.1 405B de Meta a obtenu 68,9 %, et le Qwen2.5-VL-72B de l'Académie DAMO d'Alibaba a atteint 65,2 %. Ces scores représentent une amélioration de 3 à 5 points de pourcentage par rapport à la mise à jour précédente pour la plupart des modèles, indiquant des progrès réguliers dans le raisonnement multimodal.
Méthodologie d'évaluation
MMMU 2025.9 utilise un protocole d'évaluation en zero-shot, ce qui signifie que les modèles ne sont pas affinés sur le benchmark avant le test. Chaque modèle reçoit le texte de la question et l'image, et doit sélectionner la bonne réponse parmi quatre options. Le benchmark emploie une métrique de précision stricte, sans crédit partiel. Pour réduire la variance, chaque modèle est exécuté trois fois avec des graines aléatoires différentes, et le score moyen est rapporté. Le harnais d'évaluation est publiquement disponible, permettant à des tiers de reproduire les résultats. Le benchmark inclut également une référence humaine : un groupe de 50 étudiants universitaires dans des filières pertinentes a obtenu un score moyen de 85,7 %, fournissant un point de référence pour la performance de l'IA.
Impact et utilisation
MMMU 2025.9 est devenu une référence standard pour comparer les systèmes d'IA multimodaux. Des entreprises telles que OpenAI, Anthropic et Google DeepMind utilisent le benchmark pour suivre leurs progrès et publier leurs résultats. Des institutions académiques, notamment Stanford AI Lab et Berkeley AI Research, citent les scores MMMU dans des articles sur l'apprentissage multimodal et les modèles vision-langage. Le benchmark influence également le développement d'architectures basées sur transformer, car les chercheurs analysent les schémas d'échec pour améliorer les mécanismes d'attention et les couches de attention croisée. La mise à jour 2025.9 a introduit un classement qui permet aux utilisateurs de filtrer les résultats par taille de modèle, domaine et type de raisonnement, facilitant une analyse plus granulaire.
Orientations futures
L'équipe MMMU a annoncé que la mise à jour 2025.10 étendra l'ensemble de questions à 12 000 éléments et ajoutera une nouvelle catégorie pour le raisonnement temporel dans des clips vidéo. Ils prévoient également d'introduire un « mode difficile » avec des problèmes multi-étapes plus complexes. Le benchmark reste un outil clé pour mesurer les progrès vers une compréhension de l'IA au niveau humain, alors que l'écart entre les meilleurs modèles et la référence humaine se réduit. En septembre 2025, le meilleur modèle d'IA se situe à 3,3 points de pourcentage de la moyenne humaine, une amélioration significative par rapport à l'écart de 10 points observé au début de 2024.