MMMU 2025.10 est la dixième mise à jour planifiée du benchmark MMMU (Massive Multi-discipline Multimodal Understanding) publiée en 2025. MMMU est une suite d'évaluation largement utilisée pour les systèmes d'intelligence artificielle qui traitent à la fois des informations visuelles et textuelles, tels que les grands modèles de langage dotés de capacités de vision. La version 2025.10 poursuit la tradition du benchmark d'ajouter de nouvelles questions et tâches pour suivre les progrès des modèles de apprentissage automatique et de apprentissage profond.
La mise à jour a été introduite en octobre 2025, suivant le modèle de publications mensuelles commencé plus tôt cette année-là. Chaque mise à jour de la série 2025 a visé à maintenir le benchmark à jour face à l'évolution rapide des modèles multimodaux d'organisations comme OpenAI, Anthropic et Google DeepMind. L'édition 2025.10 se concentre spécifiquement sur l'expansion de la couverture dans des domaines où les versions antérieures de 2025 présentaient des lacunes, notamment le raisonnement complexe avec des graphiques et des diagrammes, ainsi que la compréhension de trames vidéo.
Structure du benchmark
MMMU 2025.10 conserve la structure de base du benchmark MMMU original, qui organise les questions à travers plusieurs disciplines académiques. Celles-ci incluent l'art, les affaires, les sciences, l'ingénierie et les sciences humaines. Chaque question associe une image - telle qu'une photographie, un graphique ou un schéma - à une question à choix multiples. La mise à jour 2025.10 ajoute environ 1 500 nouvelles questions, portant le total à plus de 12 000. Les nouveaux éléments mettent l'accent sur le raisonnement en plusieurs étapes, où un modèle doit combiner des indices visuels avec des connaissances du domaine pour arriver à la bonne réponse.
Le benchmark est conçu pour être difficile pour même les systèmes de réseaux neuronaux les plus avancés. Contrairement aux tâches plus simples de réponse à des questions visuelles, les questions MMMU exigent souvent une expertise de niveau universitaire. Par exemple, une question peut montrer un schéma de circuit et demander ses propriétés électriques, ou afficher une peinture historique et interroger sur son contexte culturel.
Score et évaluation
Les modèles sont évalués sur la précision, mesurée comme le pourcentage de questions correctement répondues. La mise à jour 2025.10 a introduit un protocole d'évaluation plus strict qui pénalise les modèles fournissant des réponses correctes avec un raisonnement incorrect. Ce changement a été fait en réponse à des préoccupations selon lesquelles certains modèles devinaient correctement sans compréhension réelle. L'évaluation inclut également un sous-ensemble de questions sans réponse unique correcte, conçu pour tester la capacité d'un modèle à reconnaître l'incertitude.
Les résultats de 2025.10 ont montré que les principaux modèles de OpenAI, Anthropic et Google DeepMind ont atteint des scores de précision dans la plage de 70 à 80 pour cent, en hausse par rapport au milieu des années 60 au début de 2025. Les modèles open-source plus petits, comme ceux de Alibaba DAMO Academy, ont généralement obtenu des scores dans les 50 à 60, soulignant l'écart entre les modèles de pointe et les modèles accessibles.
Impact sur le développement des modèles
La mise à jour 2025.10 a influencé la manière dont les développeurs entraînent et affinent les systèmes multimodaux. De nombreuses équipes utilisent MMMU comme benchmark clé pendant le développement, aux côtés d'autres évaluations comme les tests de raisonnement en intelligence artificielle. Les nouvelles questions axées sur le raisonnement ont poussé les chercheurs à améliorer des techniques telles que le raisonnement en chaîne de pensée et le Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours d'IA).
Plusieurs architectures basées sur transformers ont été spécifiquement ajustées pour bien performer sur MMMU. Par exemple, le modèle de vision GPT-5 de OpenAI et Claude 4.5 d'Anthropic ont tous deux rapporté l'utilisation des résultats MMMU 2025.10 pour guider les ajustements post-entraînement. Le benchmark a également été utilisé par des laboratoires académiques comme MIT CSAIL et Stanford AI Lab pour comparer des méthodes d'entraînement novatrices, y compris des stratégies de apprentissage curriculaire et de augmentation de données.
Critiques et limites
Malgré sa popularité, MMMU 2025.10 a fait face à des critiques. Certains chercheurs soutiennent que le format à choix multiples du benchmark ne reflète pas l'utilisation réelle, où les modèles doivent générer des réponses ouvertes. D'autres notent que la banque de questions peut être mémorisée au fil du temps, conduisant à des scores gonflés. La mise à jour 2025.10 a tenté d'atténuer cela en faisant tourner les questions plus anciennes et en introduisant un mode d'évaluation dynamique, mais des préoccupations persistent.
De plus, la forte dépendance du benchmark à un contenu en anglais et à des programmes académiques occidentaux a été signalée comme une limitation. Les efforts pour ajouter des questions multilingues et culturellement diverses ont été lents, la version 2025.10 n'ajoutant qu'un petit nombre d'éléments non anglais. Cela a conduit certaines organisations, y compris Bhabha Atomic Research Centre et Samsung Research, à développer leurs propres évaluations internes adaptées aux besoins régionaux.
Orientations futures
L'équipe MMMU a annoncé des plans pour la mise à jour 2025.11, qui se concentrera sur des tâches de raisonnement interactif et multi-tours. Cela nécessiterait que les modèles posent des questions de clarification ou demandent des images supplémentaires, allant au-delà des paires statiques question-réponse. L'équipe explore également des partenariats avec des groupes industriels comme AMD et Qualcomm pour optimiser le benchmark pour les appareils de périphérie, où les contraintes de calcul sont plus strictes.
À la fin de 2025, MMMU reste l'un des benchmarks les plus cités dans le domaine du apprentissage automatique multimodal. Son évolution continue reflète la tendance plus large vers une évaluation plus rigoureuse et réaliste des systèmes de IA générative. Que cela reste la norme reste à voir, mais son influence sur le développement des modèles est indéniable.