Traduit de l'anglais

MMMU est un benchmark de novembre 2023 destiné à évaluer les grands modèles de langage multimodaux sur des tâches de raisonnement expert de niveau universitaire, couvrant six disciplines, à l'aide de 11,5K questions collectées manuellement. Il est devenu un outil d'évaluation standard pour les systèmes d'IA de pointe.

MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark) est un benchmark conçu pour évaluer les grands modèles de langage multimodaux sur des tâches nécessitant des connaissances de niveau universitaire et un raisonnement délibéré. Publié en novembre 2023, il a été conçu pour tester la perception, les connaissances et le raisonnement de niveau expert, au-delà de la compréhension visuelle de sens commun, en utilisant des questions collectées manuellement à partir d'examens universitaires, de quiz et de manuels.

Le benchmark comprend 11,5 mille questions multimodales couvrant six disciplines : Art & Design, Affaires, Sciences, Santé & Médecine, Sciences humaines & sociales, et Technologie & Ingénierie. Ces questions couvrent 30 sujets et 183 sous-domaines, intégrant des types d'images très hétérogènes tels que des graphiques, des diagrammes, des cartes, des tableaux, des partitions musicales et des structures chimiques. Au moment de sa publication, les meilleurs modèles atteignaient seulement environ 56 % de précision, bien en dessous de la plage des experts humains de 76 à 89 %, soulignant la difficulté du benchmark.

Développement et publication

MMMU a été développé par une équipe de 22 chercheurs dirigée par Xiang Yue à l'Ohio State University et Wenhu Chen à l'University of Waterloo. L'équipe a collecté et organisé manuellement les questions pour garantir qu'elles nécessitent de véritables connaissances de niveau universitaire et un raisonnement en plusieurs étapes, plutôt qu'une simple reconnaissance de formes. Le benchmark a été présenté comme un article oral à CVPR 2024, une conférence de premier plan en vision par ordinateur, signalant son importance dans le domaine.

Conception du benchmark

Les questions de MMMU sont conçues pour être multimodales, c'est-à-dire qu'elles combinent du texte avec divers types d'images. Cette hétérogénéité est intentionnelle, car elle force les modèles à intégrer des informations visuelles provenant de sources diverses, allant des graphiques scientifiques aux compositions artistiques. Le benchmark met l'accent sur le raisonnement délibéré, exigeant des modèles qu'ils appliquent des connaissances spécifiques au sujet et des étapes logiques pour arriver à des réponses, plutôt que de se fier à des indices superficiels.

Impact et adoption

Depuis sa publication, MMMU est devenu une évaluation standard pour les modèles multimodaux de pointe. Les scores sur MMMU sont régulièrement rapportés dans les rapports techniques de systèmes tels que GPT-4o, Gemini et Qwen-VL. La difficulté du benchmark a stimulé les progrès en intelligence artificielle multimodale, poussant les développeurs à améliorer les capacités de perception et de raisonnement de niveau expert des modèles. Son utilisation répandue reflète une tendance plus large en apprentissage automatique vers des métriques d'évaluation plus rigoureuses et spécifiques au domaine.

Benchmarks connexes et contexte

MMMU s'inscrit dans un paysage de benchmarks visant à évaluer les grands modèles de langage et les systèmes multimodaux. Alors que les benchmarks antérieurs se concentraient sur les connaissances générales ou les tâches visuelles simples, MMMU cible l'expertise de niveau universitaire et la compréhension d'images hétérogènes. Cela s'aligne avec les efforts d'organisations comme OpenAI, Anthropic et Google DeepMind pour développer des modèles capables de gérer des problèmes complexes du monde réel. L'accent mis par le benchmark sur le raisonnement délibéré est également lié à la recherche en apprentissage profond et en réseaux de neurones, en particulier dans des domaines comme les transformeurs et l'attention multi-têtes.

Limites et orientations futures

Malgré son succès, MMMU présente des limites. Le processus de collecte manuelle est laborieux, et la nature statique du benchmark peut conduire à une saturation à mesure que les modèles s'améliorent. Les chercheurs ont noté que des scores élevés sur MMMU ne se traduisent pas nécessairement par des performances robustes dans des contextes dynamiques du monde réel. Les futurs benchmarks devront peut-être intégrer des méthodes d'évaluation plus adaptatives ou génératives, en s'appuyant sur les fondations de MMMU pour relever ces défis.

Références

  • Yue, X., et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. arXiv preprint.
  • Présentation orale à CVPR 2024.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·multimodal·evaluation·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique