MMMU 2025.4 est la quatrième mise à jour du benchmark Massive Multi-discipline Multimodal Understanding (MMMU) publié en 2025. Il s'agit d'un ensemble de données conçu pour évaluer les capacités des systèmes d'intelligence artificielle, en particulier les grands modèles de langage dotés de traitement visuel, sur des tâches nécessitant des connaissances de niveau universitaire dans plusieurs disciplines. Le benchmark se compose de questions combinant images, diagrammes et texte, testant la capacité d'un modèle à percevoir les informations visuelles, à raisonner à leur sujet et à appliquer des connaissances spécifiques à un domaine pour répondre correctement.
La série de benchmarks MMMU a été créée pour répondre au besoin d'une évaluation rigoureuse des systèmes d'IA multimodaux au-delà de la simple reconnaissance d'objets ou du sous-titrage. Contrairement aux benchmarks antérieurs axés sur la réponse à des questions visuelles de base, les questions MMMU sont tirées de manuels universitaires et de supports d'examen, couvrant des sujets tels que la physique, la chimie, la médecine, l'histoire de l'art et l'ingénierie. Chaque question exige que le modèle intègre des indices visuels avec un contexte textuel et implique souvent un raisonnement en plusieurs étapes. La mise à jour 2025.4 poursuit cette tradition, ajoutant de nouvelles questions et affinant la méthodologie d'évaluation pour suivre le rythme des avancées rapides des capacités des modèles.
Structure et contenu du benchmark
MMMU 2025.4 maintient la structure de base de ses prédécesseurs, organisant les questions en six grandes disciplines : Art et Design, Affaires, Sciences, Santé et Médecine, Sciences humaines et sociales, et Technologie et Ingénierie. Chaque discipline est ensuite divisée en sujets spécifiques, tels que la comptabilité, la biologie, le droit ou l'informatique. Les questions sont à choix multiples, avec quatre ou cinq options, et sont conçues pour être difficiles même pour les modèles les plus avancés. L'ensemble de données comprend un ensemble de validation pour le développement et un ensemble de test pour l'évaluation finale, avec des réponses non divulguées au public pour éviter la contamination des données.
Les questions de MMMU 2025.4 sont remarquables par leur dépendance à des entrées visuelles complexes, notamment des graphiques, des diagrammes, des images médicales, des schémas de circuits et des photographies historiques. Par exemple, une question pourrait présenter un schéma de circuit et demander le flux de courant, ou montrer une lame d'histologie et exiger l'identification d'une condition pathologique. Cette conception force les modèles à effectuer une analyse visuelle fine, nécessitant souvent de zoomer sur des régions spécifiques ou d'interpréter des différences visuelles subtiles. Le benchmark inclut également des questions où l'information visuelle est partiellement non pertinente ou trompeuse, testant la capacité d'un modèle à se concentrer sur les détails pertinents.
Évaluation et notation
Les modèles sont évalués sur leur précision à répondre aux questions à choix multiples. La métrique principale est la précision globale, mais les résultats sont également rapportés par discipline et par sujet pour fournir une vue granulaire des forces et des faiblesses. Le benchmark utilise un protocole d'évaluation en zero-shot, ce qui signifie que les modèles ne sont pas affinés sur les données MMMU avant le test. Cela vise à mesurer les capacités générales de raisonnement et de récupération de connaissances d'un modèle plutôt que sa capacité à mémoriser des schémas spécifiques au benchmark.
La notation est effectuée en comparant la réponse prédite du modèle à la vérité terrain. Pour les modèles qui génèrent du texte libre, une étape d'analyse extrait l'option sélectionnée. Le classement officiel suit les soumissions de divers groupes de recherche et entreprises, y compris OpenAI, Anthropic, Google DeepMind et d'autres. La mise à jour 2025.4 a introduit un harnais d'évaluation plus strict pour réduire les biais potentiels, tels que le biais de position où les modèles tendent à favoriser certains choix de réponse. Cela inclut la randomisation de l'ordre des réponses entre les questions et l'utilisation d'une méthode d'extraction de réponses plus robuste.
Contexte historique et évolution
Le benchmark MMMU original a été introduit fin 2023 par une équipe de chercheurs de plusieurs universités, y compris Carnegie Mellon University et Stanford AI Lab. Il est rapidement devenu un point de référence standard pour l'évaluation des modèles multimodaux, aux côtés d'autres benchmarks comme VQA et ScienceQA. Le benchmark a été régulièrement mis à jour pour refléter la complexité croissante des systèmes d'IA. La version 2025.4 fait partie d'une série de mises à jour en 2025, suivant 2025.1, 2025.2 et 2025.3, chacune ajoutant de nouvelles questions et ajustant parfois le mélange de sujets pour couvrir des domaines émergents.
Un changement significatif dans les mises à jour de 2025 est l'inclusion de davantage de questions nécessitant un raisonnement temporel ou causal, reflétant un changement dans la recherche en IA vers la compréhension des processus dynamiques. Par exemple, certaines questions portent sur la séquence d'événements dans un processus biologique ou la progression d'une défaillance mécanique. Cela s'aligne avec les développements des modèles de apprentissage profond qui intègrent des architectures Transformer (architecture) avec des capacités de raisonnement améliorées. Les mises à jour ont également élargi la couverture des contextes non occidentaux, comme les questions d'histoire de l'art présentant des artefacts asiatiques ou africains, pour réduire le biais culturel dans l'évaluation.
Impact et réception
MMMU 2025.4 a été largement utilisé par la communauté de recherche en IA pour évaluer de nouveaux modèles. Les résultats du benchmark sont souvent cités dans les articles de recherche et les rapports techniques, influençant les perceptions de la qualité des modèles. Par exemple, un modèle qui performe bien sur MMMU est souvent considéré comme ayant de fortes compétences en raisonnement multimodal, ce qui est précieux pour des applications dans l'éducation, la santé et les systèmes autonomes. Le benchmark a également été utilisé en interne par des entreprises comme Amazon Web Services et Google Cloud pour guider le développement de leurs services d'IA.
Les critiques ont noté que MMMU, comme tous les benchmarks, a des limites. Certains soutiennent que le format à choix multiples ne capture pas pleinement le raisonnement du monde réel, où les réponses ne sont pas prédéfinies de manière nette. D'autres soulignent que la dépendance du benchmark à des connaissances de niveau universitaire peut ne pas refléter les besoins des utilisateurs quotidiens. Malgré ces préoccupations, MMMU 2025.4 reste un outil clé pour suivre les progrès en IA générative et en compréhension multimodale. Ses mises à jour continues garantissent qu'il reste pertinent à mesure que les modèles évoluent, fournissant une cible mobile qui pousse le domaine vers l'avant.
Directions futures
Les créateurs de MMMU ont indiqué des plans pour d'autres mises à jour, incluant potentiellement des questions plus ouvertes et des tâches interactives. Il y a également des discussions sur l'incorporation d'entrées vidéo, ce qui exigerait que les modèles traitent des informations temporelles à travers les images. En début 2026, aucune annonce officielle n'a été faite concernant la prochaine version, mais le schéma de mises à jour trimestrielles suggère que MMMU 2025.5 ou une version 2026 pourrait être à venir. L'évolution du benchmark reflète la trajectoire plus large de l'évaluation en IA, passant de la reconnaissance de motifs simple à un raisonnement complexe en plusieurs étapes qui imite la performance experte humaine.