MMMU 2025 est un benchmark conçu pour évaluer les capacités des systèmes d'intelligence artificielle multimodaux, en particulier les grands modèles de langage dotés de compréhension visuelle. Il prolonge le benchmark original MMMU (Massive Multi-discipline Multimodal Understanding), publié fin 2023 par un consortium de chercheurs issus d'institutions telles que l'Université de l'Alberta et l'Université Carleton. L'édition 2025 met à jour le benchmark pour refléter les progrès rapides de la recherche en Generative AI et en Large language model, introduisant de nouvelles tâches et des questions plus difficiles qui exigent un raisonnement approfondi dans plusieurs disciplines.
Le benchmark évalue les modèles sur leur capacité à percevoir et à raisonner sur des informations visuelles - telles que des images, des diagrammes et des graphiques - combinées à des questions textuelles. Il couvre un large éventail de sujets, notamment les sciences humaines, les sciences sociales, les domaines STEM et les domaines professionnels comme la médecine et le droit. MMMU 2025 est conçu pour être un test rigoureux de compréhension de niveau universitaire, exigeant des modèles qu'ils reconnaissent non seulement les éléments visuels, mais aussi qu'ils appliquent des connaissances spécifiques à un domaine et un raisonnement en plusieurs étapes. Le benchmark est devenu un point de référence standard pour comparer les performances des principaux systèmes d'IA d'organisations comme OpenAI, Anthropic et Google DeepMind.
Conception des tâches et évaluation
MMMU 2025 se compose de questions à choix multiples, chacune associée à une image ou à un ensemble d'images. Les questions sont conçues pour exiger une synthèse des indices visuels et du contexte textuel, demandant souvent des connaissances qui vont au-delà de la simple reconnaissance de formes. Par exemple, une question peut présenter un schéma de circuit et interroger sur l'effet d'un changement de composant, ou montrer une peinture historique et s'enquérir de sa signification culturelle. Le benchmark comprend plus de 30 000 questions réparties dans 30 disciplines, avec un accent sur les questions difficiles pour les modèles actuels.
L'évaluation est effectuée en utilisant la précision comme métrique principale, les modèles devant produire une seule réponse correcte parmi un ensemble d'options. Le benchmark suit également les performances par discipline et par type de question, permettant aux chercheurs d'identifier les forces et les faiblesses spécifiques. Dans l'édition 2025, un nouveau sous-ensemble de questions a été ajouté, exigeant des modèles qu'ils raisonnent sur plusieurs images simultanément, testant leur capacité à comparer et à contraster les informations visuelles. Cette conception pousse les modèles au-delà du simple sous-titrage d'images et dans le domaine du raisonnement visuel et de la résolution de problèmes.
Principaux résultats et performances des modèles
Début 2025, les modèles les plus performants sur MMMU 2025 atteignent des scores de précision dans la fourchette du milieu des années 80 en pourcentage, une amélioration significative par rapport au MMMU original où les meilleurs modèles obtenaient environ 50 à 60 %. Ces progrès sont attribués aux avancées dans les architectures Transformer (architecture), à des ensembles de données d'entraînement plus volumineux et à des techniques d'entraînement améliorées telles que Reinforcement Learning from AI Feedback (RLAIF) et Curriculum Learning. Notamment, les modèles d'OpenAI et de Google DeepMind ont constamment dominé le classement, leurs dernières versions démontrant des performances proches du niveau humain dans certaines disciplines comme la physique et la biologie.
Cependant, le benchmark révèle des lacunes persistantes. Les modèles ont encore du mal avec les questions qui exigent un raisonnement abstrait, des connaissances de sens commun ou la compréhension de relations spatiales complexes. Les performances varient également considérablement selon les disciplines, les sciences humaines et sociales s'avérant souvent plus difficiles que les domaines STEM purs. Les créateurs du benchmark soulignent que MMMU 2025 n'est pas un problème résolu et qu'il continue de servir de motivation pour la recherche dans des domaines comme les mécanismes de Multi-Head Attention et de Cross-Attention qui peuvent mieux intégrer les informations visuelles et textuelles.
Comparaison avec d'autres benchmarks
MMMU 2025 fait partie d'un écosystème plus large de benchmarks d'évaluation de l'IA. Il complète d'autres tests bien connus tels que le benchmark Visual Question Answering (VQA) et la suite General Language Understanding Evaluation (GLUE). Contrairement à VQA, qui se concentre sur des questions simples concernant des scènes quotidiennes, MMMU 2025 cible un contenu académique de niveau universitaire, ce qui le rend plus aligné sur l'objectif de développer une IA capable d'assister dans l'éducation et le travail professionnel. Par rapport aux benchmarks textuels comme GLUE, MMMU 2025 ajoute la dimension critique de la compréhension visuelle, essentielle pour des applications telles que la conduite autonome, l'imagerie médicale et la robotique.
Le benchmark diffère également des nouveaux benchmarks multimodaux comme Massive Multitask Language Understanding (MMLU) en ce qu'il exige une entrée visuelle pour chaque question, tandis que MMLU est uniquement textuel. Cela fait de MMMU 2025 un test plus direct de la capacité d'un modèle à traiter des données réelles, souvent multimodales. Les chercheurs utilisent souvent MMMU 2025 en conjonction avec d'autres benchmarks pour obtenir une vue complète des capacités d'un modèle, car aucun benchmark unique ne peut capturer tous les aspects de l'intelligence.
Impact et orientations futures
L'introduction de MMMU 2025 a eu un impact significatif sur le domaine de l'Artificial intelligence. Elle a stimulé la recherche sur des encodeurs visuels plus robustes, une meilleure fusion des caractéristiques visuelles et textuelles et des méthodes d'entraînement plus efficaces. Des entreprises comme AMD, Intel et TSMC en ont également pris note, car les exigences computationnelles du benchmark soulignent le besoin de matériel spécialisé comme les accélérateurs AWS Trainium et Groq pour exécuter ces modèles efficacement.
À l'avenir, les créateurs de MMMU 2025 prévoient de publier des versions mises à jour avec des questions encore plus difficiles, y compris des tâches ouvertes qui exigent des modèles qu'ils génèrent des explications plutôt que de simplement sélectionner des réponses. Il est également question d'incorporer des modalités vidéo et audio, ce qui repousserait encore davantage les limites de la compréhension multimodale. Alors que les modèles d'IA continuent de s'améliorer, des benchmarks comme MMMU 2025 joueront un rôle crucial dans la mesure des progrès et l'identification des domaines où l'intelligence au niveau humain reste hors de portée.