MMMU-Pro est un ensemble de données de référence conçu pour évaluer les capacités des systèmes d'intelligence artificielle multimodaux, en particulier les grands modèles multimodaux qui traitent à la fois des informations visuelles et textuelles. Il constitue un successeur amélioré et plus exigeant du benchmark original MMMU (Massive Multi-discipline Multimodal Understanding), ciblant une expertise de niveau professionnel dans diverses disciplines académiques et techniques. Le benchmark est structuré pour tester la capacité d'un modèle à intégrer et à raisonner sur des images, des diagrammes, des graphiques et des textes associés, d'une manière qui exige une connaissance approfondie du domaine, et non pas seulement une reconnaissance de formes.
Le benchmark MMMU original, publié fin 2023, comprenait des questions tirées de manuels et d'examens de niveau universitaire dans six disciplines : art, commerce, sciences, sciences humaines, sciences sociales et technologie. MMMU-Pro a été introduit en 2024 pour remédier aux limites de l'original, notamment la tendance de certains modèles à obtenir des scores élevés en exploitant des régularités statistiques ou des réponses mémorisées. MMMU-Pro augmente la difficulté des questions, introduit des éléments visuels plus complexes et met en œuvre un protocole d'évaluation plus strict, comprenant des questions à choix multiples avec un ensemble d'options plus large et une méthode de notation plus rigoureuse, réduisant ainsi l'impact des réponses aléatoires.
Conception et construction
MMMU-Pro a été construit par une équipe de chercheurs de plusieurs institutions, avec des contributions de laboratoires académiques et de groupes de recherche industriels. L'ensemble de données s'appuie sur le MMMU original mais ajoute un niveau d'examen professionnel. Les questions proviennent d'une gamme plus large de matériaux, y compris des manuels avancés, des examens de certification professionnelle et des articles de recherche. Chaque question est associée à une image ou à un ensemble d'images qui sont essentielles pour résoudre le problème, et le texte est conçu pour exiger un raisonnement en plusieurs étapes.
Un choix de conception clé dans MMMU-Pro est l'expansion des choix de réponses. Alors que le MMMU original utilisait quatre options par question, MMMU-Pro en utilise généralement dix. Ce changement réduit considérablement la probabilité qu'un modèle devine correctement par hasard, faisant du benchmark une mesure plus fiable de la compréhension réelle. De plus, le benchmark inclut un sous-ensemble de questions où l'information visuelle est intentionnellement trompeuse ou nécessite une inspection minutieuse pour extraire les détails pertinents, testant la capacité d'un modèle à se concentrer sur les informations pertinentes plutôt que sur les distracteurs.
Protocole d'évaluation
L'évaluation sur MMMU-Pro suit un protocole strict pour garantir l'équité et la reproductibilité. Les modèles reçoivent le texte de la question et l'image associée, et doivent produire l'un des dix choix de réponses. La métrique principale est la précision, mais le benchmark rapporte également les performances ventilées par discipline et par type de question (par exemple, interprétation de diagrammes, lecture de graphiques ou raisonnement visuel).
Pour réduire davantage l'impact des réponses aléatoires, MMMU-Pro inclut une condition « sans image ». Dans cette condition, les modèles sont évalués sur les mêmes questions mais sans les images associées. Cela sert de contrôle pour mesurer dans quelle mesure un modèle s'appuie sur les informations visuelles par rapport aux connaissances textuelles. Un modèle qui performe bien dans la condition sans image mais mal dans la condition complète peut être en sur-apprentissage des schémas linguistiques, tandis qu'un modèle qui performe bien dans les deux conditions démontre une intégration multimodale robuste.
Performance des modèles leaders
À la fin de 2024, aucun modèle n'a atteint un niveau de performance humain sur MMMU-Pro. Les meilleurs systèmes, qui incluent des modèles propriétaires de grandes entreprises d'IA telles que OpenAI, Google DeepMind et Anthropic, obtiennent généralement une précision de 50 à 60 % sur le benchmark complet. C'est une baisse significative par rapport aux 70 à 80 % de précision que ces mêmes modèles atteignent sur le MMMU original, soulignant la difficulté accrue.
Les modèles open-source, tels que ceux développés par des groupes académiques et des petites entreprises, obtiennent généralement des scores plus bas, souvent dans la plage de 30 à 45 %. L'écart entre les modèles propriétaires et open-source est plus prononcé sur MMMU-Pro que sur des benchmarks plus simples, ce qui suggère que le raisonnement de niveau professionnel requis est un goulot d'étranglement actuel pour de nombreuses architectures de réseaux de neurones. Le benchmark est devenu un point de référence standard dans la communauté de l'intelligence artificielle pour suivre les progrès en compréhension multimodale, les chercheurs rapportant régulièrement leurs résultats dans des articles et des rapports techniques.
Impact et limites
MMMU-Pro a influencé le développement des modèles multimodaux en mettant en évidence des faiblesses spécifiques. Par exemple, de nombreux modèles ont du mal avec les questions qui exigent un raisonnement spatial ou l'interprétation de diagrammes scientifiques complexes, comme ceux que l'on trouve dans les articles de recherche en apprentissage profond. Cela a stimulé des travaux sur l'amélioration des encodeurs visuels et sur des techniques d'entraînement qui mettent l'accent sur le raisonnement plutôt que sur la mémorisation.
Cependant, le benchmark n'est pas sans limites. Les critiques notent que les questions, bien que difficiles, sont toujours à choix multiples, ce qui peut permettre aux modèles d'utiliser des stratégies d'élimination. De plus, l'ensemble de données est statique, ce qui signifie qu'une fois qu'un modèle a été entraîné sur celui-ci (ou sur des données similaires), les résultats peuvent être gonflés. Les créateurs de MMMU-Pro ont reconnu cela et ont publié périodiquement des versions mises à jour avec de nouvelles questions.
Une autre limite est le potentiel de contamination des données. Étant donné que le benchmark est publiquement disponible, il est possible que certains ensembles de données d'entraînement pour les grands modèles incluent des questions de MMMU-Pro, ce qui gonflerait artificiellement les scores. Les chercheurs ont appelé à des rapports plus transparents sur les données d'entraînement pour atténuer ce problème. Malgré ces préoccupations, MMMU-Pro reste l'un des benchmarks publics les plus rigoureux pour évaluer la compréhension multimodale de niveau professionnel dans les systèmes de IA générative.
Orientations futures
Le développement de MMMU-Pro s'inscrit dans une tendance plus large de l'évaluation de l'IA vers des benchmarks plus difficiles et écologiquement valides. Les itérations futures pourraient inclure des questions ouvertes, des tâches interactives ou des scénarios de résolution de problèmes du monde réel allant au-delà du format à choix multiples. L'accent mis par le benchmark sur l'expertise professionnelle s'aligne sur le déploiement croissant de l'IA dans des domaines comme la médecine, le droit et l'ingénierie, où les erreurs peuvent avoir des conséquences significatives.
À mesure que les modèles continuent de s'améliorer, des benchmarks comme MMMU-Pro devront évoluer pour rester pertinents. La communauté de recherche explore également des méthodes d'évaluation complémentaires, telles que l'évaluation humaine et les tests adversariaux, pour fournir une image plus complète des capacités des modèles. MMMU-Pro, avec son accent sur la profondeur et la rigueur, sert d'outil précieux dans cet effort continu pour comprendre et faire progresser l'état de l'art en IA multimodale.