MMMU-Bench est une suite de références conçue pour évaluer les capacités des systèmes d'intelligence artificielle multimodaux, en particulier les grands modèles multimodaux qui traitent à la fois des informations visuelles et textuelles. Elle a été introduite pour répondre au besoin d'évaluations rigoureuses de niveau universitaire, allant au-delà de la simple reconnaissance d'objets ou de la correspondance de légendes, ciblant des compétences d'ordre supérieur telles que la perception, l'application des connaissances et le raisonnement complexe. La référence comprend un ensemble diversifié de questions tirées de manuels universitaires, de quiz et d'examens, couvrant un large éventail de disciplines académiques.
L'objectif principal de MMMU-Bench est de mesurer la capacité d'un modèle à intégrer et à raisonner sur plusieurs modalités, y compris les images, les diagrammes, les graphiques et le texte. Contrairement aux références antérieures qui se concentraient sur des tâches étroites, MMMU-Bench met l'accent sur la compréhension multidisciplinaire, exigeant des modèles qu'ils appliquent des connaissances spécifiques à des domaines tels que l'art, l'ingénierie, la médecine et les sciences sociales. Elle sert de test de stress pour les grands modèles de langage modernes étendus avec des capacités de vision, révélant les forces et les limites dans des scénarios éducatifs réels.
Structure et composition
MMMU-Bench se compose de 11 500 questions à choix multiples soigneusement sélectionnées, chacune accompagnée d'entrées visuelles telles que des photographies, des diagrammes ou des figures scientifiques. Les questions sont organisées en 30 sujets distincts, regroupés en six disciplines majeures : Art et Design, Affaires, Science, Santé et Médecine, Sciences humaines et sociales, et Technologie et Ingénierie. Chaque question est conçue pour exiger à la fois une compréhension visuelle et un raisonnement spécifique au domaine, demandant souvent une inférence en plusieurs étapes qui combine des indices textuels avec des preuves visuelles.
La référence comprend un ensemble de validation et un ensemble de test, ce dernier étant utilisé pour les classements officiels. Les questions sont issues de matériels éducatifs authentiques, y compris des manuels universitaires et des notes de cours, garantissant un niveau élevé de difficulté et de pertinence. Le processus d'annotation a impliqué des réviseurs experts qui ont vérifié l'exactitude des réponses et la clarté des informations visuelles, visant à minimiser l'ambiguïté et les biais.
Méthodologie d'évaluation
Les modèles sont évalués sur leur précision à sélectionner la bonne réponse parmi quatre options ou plus. La référence exige que les modèles traitent l'entrée visuelle en parallèle du texte de la question, générant une réponse qui reflète une compréhension intégrée. L'évaluation est généralement menée dans un cadre zéro-shot, où les modèles ne sont pas affinés sur les données de la référence, afin d'évaluer la capacité de généralisation. Certaines évaluations incluent également un amorçage few-shot, fournissant un petit nombre d'exemples pour guider le format de réponse du modèle.
Le score est simple : le pourcentage de questions correctement répondues dans tous les sujets, avec des ventilations supplémentaires par discipline et par domaine. Ce rapport granulaire permet aux chercheurs d'identifier des forces et des faiblesses spécifiques, telles que de mauvaises performances sur les graphiques ou les diagrammes par rapport aux images naturelles. La référence suit également les performances sur des questions nécessitant des connaissances externes par rapport à celles résolubles purement à partir du contexte donné, fournissant des informations sur la profondeur du raisonnement du modèle.
Importance dans la recherche en IA
MMMU-Bench est devenue une référence largement citée dans le développement des modèles multimodaux. Elle met en évidence l'écart entre les performances universitaires humaines et les capacités actuelles de l'IA, en particulier dans les tâches qui exigent un raisonnement intermodal et des connaissances spécialisées. Par exemple, les modèles excellent souvent à reconnaître des objets mais peinent à interpréter des figures scientifiques complexes ou à appliquer des formules mathématiques à des données visuelles. La référence a stimulé la recherche sur l'amélioration de l'alignement vision-langage, les mécanismes d'attention et les stratégies d'entraînement intégrant des ensembles de données multimodaux diversifiés.
Son introduction a coïncidé avec un regain d'intérêt pour l'IA générative et la mise à l'échelle des architectures basées sur transformeurs. Des entreprises et des laboratoires de recherche, y compris ceux associés à OpenAI, Google DeepMind et Anthropic, ont utilisé MMMU-Bench pour évaluer leurs modèles propriétaires, publiant des résultats qui informent la perception publique des progrès. La référence sert également d'outil pour comparer les modèles open-source et fermés, favorisant la concurrence et la collaboration dans le domaine.
Limites et critiques
Malgré sa rigueur, MMMU-Bench a fait face à des critiques. Certains chercheurs soutiennent que le format à choix multiples peut ne pas capturer pleinement les capacités de raisonnement ouvert, et que les entrées visuelles, bien que diversifiées, peuvent ne pas représenter tous les scénarios multimodaux réels. Il existe également des préoccupations concernant une éventuelle contamination des données, où des modèles entraînés sur des données à l'échelle d'Internet pourraient avoir mémorisé des questions similaires, gonflant les scores. La dépendance de la référence à des matériels en anglais limite son applicabilité à d'autres langues et contextes culturels.
De plus, la difficulté des questions varie selon les sujets, rendant les comparaisons interdisciplinaires difficiles. Certains sujets, comme l'histoire de l'art, reposent fortement sur la reconnaissance du style visuel, tandis que d'autres, comme la physique, exigent un raisonnement quantitatif. Cette hétérogénéité signifie qu'un score agrégé unique peut masquer des nuances importantes. À ce jour, aucun modèle n'a atteint des performances de niveau humain sur l'ensemble de la référence, indiquant une marge d'amélioration substantielle.
Orientations futures
Les créateurs de MMMU-Bench continuent de mettre à jour la référence, ajoutant potentiellement de nouveaux types de questions, tels que des réponses ouvertes ou des tâches interactives. Il existe également un intérêt pour développer des versions intégrant des données vidéo ou 3D, reflétant l'évolution de l'IA multimodale. Les chercheurs explorent comment utiliser MMMU-Bench pour guider l'apprentissage curriculaire et les stratégies d'augmentation des données, visant à améliorer la robustesse des modèles. La référence reste une référence clé pour mesurer les progrès vers l'intelligence artificielle générale, en particulier dans le domaine de la compréhension visuelle et textuelle.
Alors que les modèles de apprentissage automatique deviennent plus intégrés dans les outils éducatifs et les applications professionnelles, des références comme MMMU-Bench joueront un rôle crucial pour garantir la fiabilité et la sécurité. En fixant des normes élevées pour le raisonnement multidisciplinaire, elle pousse le domaine vers des systèmes d'IA plus capables et dignes de confiance.