MMMU 2025.1 est la première mise à jour du benchmark de compréhension multimodale multidisciplinaire Massive Multi-discipline Multimodal Understanding en 2025. Il étend le cadre original de MMMU, conçu pour évaluer les systèmes d'intelligence artificielle sur des tâches nécessitant à la fois la perception visuelle et le raisonnement spécifique à un domaine. La mise à jour introduit de nouveaux formats de questions, des disciplines supplémentaires et des protocoles de notation révisés pour mieux refléter les capacités des grands modèles de langage et des modèles multimodaux modernes.
Le benchmark reste une référence clé pour les chercheurs et les développeurs travaillant sur les systèmes de apprentissage profond qui combinent vision et langage. En fournissant un ensemble standardisé de défis, MMMU 2025.1 aide à comparer les performances de différents modèles, y compris ceux basés sur les architectures transformers et les conceptions de réseaux de neurones.
Structure du benchmark
MMMU 2025.1 conserve la structure de base du benchmark original, qui comprend des questions à choix multiples tirées de manuels universitaires et de notes de cours. La mise à jour ajoute une nouvelle catégorie de questions qui nécessitent un raisonnement en plusieurs étapes à travers des images et du texte, augmentant la difficulté pour les modèles qui s'appuient uniquement sur les techniques de IA générative. Le benchmark couvre des disciplines telles que la physique, la chimie, la médecine et l'ingénierie, chaque question étant associée à une ou plusieurs images essentielles pour répondre correctement.
La version 2025.1 introduit également un système de notation révisé qui pénalise plus lourdement les réponses confiantes mais incorrectes, encourageant les modèles à calibrer leur incertitude. Ce changement s'aligne sur les tendances récentes en matière d'évaluation en apprentissage automatique, où la calibration est considérée comme aussi importante que la précision brute.
Protocole d'évaluation
Les modèles sont évalués en mode zero-shot, ce qui signifie qu'ils ne sont pas affinés sur les données de MMMU avant le test. Ce protocole garantit que la performance reflète les capacités générales de raisonnement d'un modèle plutôt que la mémorisation. Le benchmark comprend un ensemble de validation pour le développement et un ensemble de test pour la notation finale, avec des résultats rapportés en pourcentages de précision.
Pour la mise à jour 2025.1, le pipeline d'évaluation a été automatisé pour gérer des sorties de modèles plus volumineuses, y compris celles de OpenAI GPT-4o et de Anthropic Claude 3.5 Sonnet, qui ont été parmi les premiers modèles testés. Le protocole prend également en charge les modèles de Google DeepMind et d'autres laboratoires de premier plan, garantissant une large applicabilité.
Principaux changements par rapport aux versions précédentes
Un changement majeur dans MMMU 2025.1 est l'inclusion de questions nécessitant un raisonnement temporel, où l'ordre des événements dans une séquence d'images est important. Cet ajout teste la capacité d'un modèle à comprendre des scènes dynamiques, une capacité cruciale pour des applications comme la conduite autonome de Waymo et Tesla Autopilot.
Un autre changement est l'expansion des types d'entrées visuelles. En plus des photographies et diagrammes statiques, le benchmark inclut désormais des graphiques, des diagrammes et des captures d'écran d'interfaces logicielles. Cette variété met les modèles au défi d'extraire des informations de formats visuels divers, une tâche qui reste difficile pour de nombreux systèmes de apprentissage profond.
La mise à jour introduit également un nouveau sous-ensemble de questions nécessitant un raisonnement cross-modal, où la réponse dépend de la combinaison d'informations provenant à la fois de l'image et du texte qui l'accompagne. Ce sous-ensemble est conçu pour tester l'intégration de la compréhension visuelle et linguistique, un objectif central des mécanismes de attention multi-têtes dans les transformers modernes.
Tendances de performance
Les premiers résultats de MMMU 2025.1 montrent que les modèles de pointe atteignent des taux de précision supérieurs à 70 %, mais il existe encore un écart significatif entre la performance humaine, qui est d'environ 90 %, et les meilleurs systèmes d'IA. Les modèles qui utilisent le raisonnement en chaîne de pensée ou des techniques de raisonnement similaires ont tendance à mieux performer, ce qui suggère que des étapes de raisonnement explicites aident dans les tâches multimodales complexes.
Cependant, le benchmark révèle également des faiblesses persistantes dans les modèles actuels, en particulier dans les tâches qui nécessitent un raisonnement spatial précis ou une compréhension de détails visuels subtils. Par exemple, les questions impliquant l'imagerie médicale ou les diagrammes d'ingénierie font souvent trébucher même les systèmes les plus avancés, soulignant la nécessité de recherches supplémentaires en vision par ordinateur et en apprentissage multimodal.
Implications pour le développement de l'IA
La publication de MMMU 2025.1 a des implications pour la communauté IA au sens large. Il fournit un banc d'essai rigoureux pour évaluer les progrès en compréhension multimodale, ce qui est essentiel pour développer des systèmes d'IA capables de fonctionner dans des environnements réels. Des entreprises comme Amazon Web Services et Google Cloud utilisent le benchmark pour évaluer leurs propres modèles et pour guider les améliorations de leurs services d'IA.
Les chercheurs d'institutions telles que Stanford AI Lab et Berkeley AI Research ont cité MMMU 2025.1 comme une ressource précieuse pour étudier les limites des modèles actuels. Le benchmark sert également de référence pour de nouvelles techniques de élagage de modèles et de augmentation de données, car les développeurs cherchent à améliorer l'efficacité sans sacrifier la précision.
Dans l'ensemble, MMMU 2025.1 représente un pas en avant dans l'évaluation de l'IA multimodale, poussant le domaine vers des systèmes plus robustes et plus capables.