MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark) est un benchmark conçu pour évaluer les grands modèles de langage multimodaux sur des tâches nécessitant des connaissances de niveau universitaire et un raisonnement délibéré. Publié en novembre 2023, il a été conçu pour tester la perception, les connaissances et le raisonnement de niveau expert, au-delà de la compréhension visuelle de sens commun, en utilisant des questions collectées manuellement à partir d'examens universitaires, de quiz et de manuels.
Le benchmark comprend 11,5 mille questions multimodales couvrant six disciplines : Art & Design, Affaires, Sciences, Santé & Médecine, Sciences humaines & sociales, et Technologie & Ingénierie. Ces questions couvrent 30 sujets et 183 sous-domaines, intégrant des types d'images très hétérogènes tels que des graphiques, des diagrammes, des cartes, des tableaux, des partitions musicales et des structures chimiques. Au moment de sa publication, les meilleurs modèles atteignaient seulement environ 56 % de précision, bien en dessous de la plage des experts humains de 76 à 89 %, soulignant la difficulté du benchmark.
Développement et publication
MMMU a été développé par une équipe de 22 chercheurs dirigée par Xiang Yue à l'Ohio State University et Wenhu Chen à l'University of Waterloo. L'équipe a collecté et organisé manuellement les questions pour garantir qu'elles nécessitent de véritables connaissances de niveau universitaire et un raisonnement en plusieurs étapes, plutôt qu'une simple reconnaissance de formes. Le benchmark a été présenté comme un article oral à CVPR 2024, une conférence de premier plan en vision par ordinateur, signalant son importance dans le domaine.
Conception du benchmark
Les questions de MMMU sont conçues pour être multimodales, c'est-à-dire qu'elles combinent du texte avec divers types d'images. Cette hétérogénéité est intentionnelle, car elle force les modèles à intégrer des informations visuelles provenant de sources diverses, allant des graphiques scientifiques aux compositions artistiques. Le benchmark met l'accent sur le raisonnement délibéré, exigeant des modèles qu'ils appliquent des connaissances spécifiques au sujet et des étapes logiques pour arriver à des réponses, plutôt que de se fier à des indices superficiels.
Impact et adoption
Depuis sa publication, MMMU est devenu une évaluation standard pour les modèles multimodaux de pointe. Les scores sur MMMU sont régulièrement rapportés dans les rapports techniques de systèmes tels que GPT-4o, Gemini et Qwen-VL. La difficulté du benchmark a stimulé les progrès en intelligence artificielle multimodale, poussant les développeurs à améliorer les capacités de perception et de raisonnement de niveau expert des modèles. Son utilisation répandue reflète une tendance plus large en apprentissage automatique vers des métriques d'évaluation plus rigoureuses et spécifiques au domaine.
Benchmarks connexes et contexte
MMMU s'inscrit dans un paysage de benchmarks visant à évaluer les grands modèles de langage et les systèmes multimodaux. Alors que les benchmarks antérieurs se concentraient sur les connaissances générales ou les tâches visuelles simples, MMMU cible l'expertise de niveau universitaire et la compréhension d'images hétérogènes. Cela s'aligne avec les efforts d'organisations comme OpenAI, Anthropic et Google DeepMind pour développer des modèles capables de gérer des problèmes complexes du monde réel. L'accent mis par le benchmark sur le raisonnement délibéré est également lié à la recherche en apprentissage profond et en réseaux de neurones, en particulier dans des domaines comme les transformeurs et l'attention multi-têtes.
Limites et orientations futures
Malgré son succès, MMMU présente des limites. Le processus de collecte manuelle est laborieux, et la nature statique du benchmark peut conduire à une saturation à mesure que les modèles s'améliorent. Les chercheurs ont noté que des scores élevés sur MMMU ne se traduisent pas nécessairement par des performances robustes dans des contextes dynamiques du monde réel. Les futurs benchmarks devront peut-être intégrer des méthodes d'évaluation plus adaptatives ou génératives, en s'appuyant sur les fondations de MMMU pour relever ces défis.
Références
- Yue, X., et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. arXiv preprint.
- Présentation orale à CVPR 2024.