MMMU 2025.5 est la cinquième mise à jour publiée en 2025 du benchmark Massive Multi-discipline Multimodal Understanding (MMMU), une suite d'évaluation largement utilisée pour les systèmes d'intelligence artificielle. Ce benchmark évalue les grands modèles de langage et les modèles associés sur leur capacité à effectuer un raisonnement de niveau universitaire dans des disciplines exigeant à la fois une compréhension visuelle et textuelle. MMMU 2025.5 poursuit la tradition de rafraîchissements périodiques du benchmark, introduisant un nouvel ensemble de questions et des procédures de notation révisées pour atténuer les effets de saturation et mieux différencier les systèmes de pointe.
Le benchmark MMMU original a été introduit en 2023 par un consortium de chercheurs académiques et industriels, incluant des équipes de Stanford AI Lab, Carnegie Mellon University et University of Toronto. Il comprend des questions tirées de manuels, de diapositives de cours et de sujets d'examen couvrant 30 matières, notamment l'art, l'ingénierie et la médecine. Chaque question intègre une image (comme un diagramme, un graphique ou une photographie) avec une question à choix multiples ou ouverte, exigeant des modèles qu'ils effectuent un raisonnement basé sur l'attention multi-têtes sur les deux modalités. La difficulté du benchmark réside dans son exigence de connaissances spécifiques au domaine et d'interprétation visuelle précise, ce qui le distingue des benchmarks de apprentissage automatique plus simples.
MMMU 2025.5 répond spécifiquement aux progrès rapides observés en 2025, où les versions antérieures de 2025 (MMMU 2025.1 à 2025.4) étaient devenues de plus en plus faciles pour les modèles de premier plan. La mise à jour ajoute environ 1 200 nouvelles questions, sélectionnées par un panel de 50 annotateurs experts issus d'institutions telles que University of Oxford et MIT CSAIL. Ces questions mettent l'accent sur le raisonnement multi-étapes, les scénarios contrefactuels et les différences visuelles fines, comme distinguer des structures anatomiques similaires ou interpréter des schémas de circuits complexes. La mise à jour introduit également une nouvelle grille de notation qui pénalise les réponses fausses trop confiantes, encourageant un calibrage de température dans les sorties des modèles.
Conception et mises à jour du benchmark
La suite MMMU est structurée en six grandes disciplines : Art et Design, Affaires, Sciences, Santé et Médecine, Sciences humaines et sociales, et Technologie et Ingénierie. Chaque discipline contient plusieurs matières, et les questions sont étiquetées avec des niveaux de difficulté (facile, moyen, difficile) basés sur la performance humaine. MMMU 2025.5 conserve cette structure mais rééquilibre la distribution : il augmente la proportion de questions difficiles de 35 % à 45 %, reflétant la nécessité de défier les modèles qui ont maîtrisé les items plus faciles. La mise à jour introduit également un nouveau sous-ensemble de « perturbation visuelle », où les images sont légèrement pivotées, recadrées ou décalées en couleur, testant la robustesse aux variations d'entrée.
Une innovation clé de MMMU 2025.5 est l'inclusion de questions de « collaboration antagoniste », développées avec la contribution de chercheurs de Google DeepMind et OpenAI. Ces questions sont conçues pour être ambiguës ou pour exiger des connaissances externes absentes de l'image, forçant les modèles à demander des clarifications ou à exprimer leur incertitude. Cela s'aligne sur les tendances plus larges de l'évaluation de la IA générative, où les benchmarks mesurent de plus en plus non seulement la précision, mais aussi la transparence du raisonnement et les modes d'échec.
Méthodologie d'évaluation
Les modèles sont évalués dans un cadre zero-shot, ce qui signifie qu'ils ne reçoivent aucun exemple préalable de questions MMMU. Le benchmark utilise un format de prompt standardisé qui inclut l'image et une instruction textuelle, et les modèles doivent générer une réponse qui est analysée pour obtenir la réponse finale. Pour les questions à choix multiples, la sortie du modèle est comparée à l'option correcte ; pour les questions ouvertes, une combinaison de correspondance exacte et de similarité sémantique (utilisant des embeddings basés sur transformeurs) est employée. MMMU 2025.5 rapporte également les performances séparément pour les modèles qui utilisent des outils externes, tels que les API Amazon Web Services ou Google Cloud, bien que cette utilisation soit déconseillée pour maintenir la comparabilité.
La notation dans MMMU 2025.5 introduit une « précision pondérée par la confiance ». Pour chaque question, le modèle doit produire un score de confiance (de 0 à 1). Le score final est la moyenne des réponses correctes pondérées par la confiance, avec une pénalité pour les erreurs de haute confiance. Cette métrique vise à capturer le calibrage, une propriété critique pour le déploiement réel dans des domaines comme la robotique Intuitive Surgical ou la conduite autonome Waymo, où les erreurs trop confiantes peuvent être coûteuses.
Tendances de performance
Au moment de la sortie de MMMU 2025.5, les modèles de premier plan d'Anthropic, OpenAI et Google DeepMind atteignent une précision de l'ordre de 78 à 82 %, contre environ 70 % sur MMMU 2025.1. Cependant, la nouvelle métrique pondérée par la confiance réduit ces scores à 65-70 %, soulignant que de nombreux modèles restent mal calibrés. Les modèles plus petits, comme ceux optimisés pour les appareils de périphérie par Qualcomm ou Arm Holdings, obtiennent généralement des scores de 20 à 30 points inférieurs, soulignant l'écart entre les systèmes de pointe et ceux déployés.
Le benchmark a également révélé des faiblesses persistantes dans le raisonnement spatial et la terminologie spécifique au domaine. Par exemple, les modèles confondent souvent les orientations gauche-droite dans l'imagerie médicale et identifient mal les structures chimiques dans les questions de chimie organique. Ces constatations ont motivé la recherche sur des techniques de apprentissage curriculaire et de augmentation de données ciblant spécifiquement ces lacunes.
Impact et réception
MMMU 2025.5 a été adopté par les grands laboratoires d'IA comme point de contrôle d'évaluation interne. OpenAI et Anthropic ont publiquement cité les scores MMMU dans les notes de version de leurs modèles, et Google DeepMind utilise le benchmark pour guider l'entraînement sur les architectures réseaux résiduels et U-Net pour les tâches de vision. Les mises à jour du benchmark sont également utilisées par les chercheurs académiques pour étudier la généralisation des modèles de apprentissage profond, avec des articles de BAIR (Berkeley AI Research) et Bhabha Atomic Research Centre analysant les schémas d'erreur.
Les critiques ont noté que la dépendance de MMMU à des matériels éducatifs en anglais et centrés sur l'Occident peut introduire un biais culturel, une préoccupation reprise par les chercheurs de Alibaba DAMO Academy et NEC. En réponse, l'équipe MMMU a annoncé des plans pour une expansion multilingue fin 2025, bien que les détails restent non confirmés. Malgré ces limites, MMMU 2025.5 reste une référence standard pour le raisonnement multimodal, complétant d'autres benchmarks comme les évaluations Chess computer pour la pensée stratégique.
Orientations futures
L'équipe MMMU, dirigée par des chercheurs principaux de Stanford AI Lab et University of Toronto, a tracé une feuille de route pour 2026. Les mises à jour prévues incluent la génération dynamique de questions utilisant des modèles de IA générative, ce qui créerait des questions uniques à chaque session d'évaluation, et l'intégration de tâches basées sur la vidéo. L'équipe explore également des partenariats avec Nokia Bell Labs et Xerox PARC pour développer des benchmarks pour les systèmes multimodaux dans des contextes industriels, tels que le contrôle qualité et la télédétection.
À mesure que les systèmes d'intelligence artificielle deviennent plus capables, des benchmarks comme MMMU 2025.5 jouent un rôle crucial pour garantir que les progrès sont mesurables et significatifs. L'accent mis par la mise à jour sur le calibrage et la robustesse reflète une maturation du domaine, allant au-delà de la précision brute vers des évaluations plus nuancées du comportement des modèles. Pour les praticiens, MMMU 2025.5 offre un banc d'essai rigoureux pour comparer les modèles et guider les priorités de développement.