MMMU 2024.3 est la troisième mise à jour publiée en 2024 du benchmark Massive Multi-discipline Multimodal Understanding (MMMU), une suite d'évaluation largement utilisée pour mesurer les capacités des systèmes d'intelligence artificielle dans des tâches de compréhension multimodale de niveau universitaire. Le benchmark est conçu pour tester les modèles dans une gamme de disciplines, notamment l'art, les affaires, les sciences et les sciences humaines, en utilisant des questions qui exigent un raisonnement sur du texte et des images. Chaque mise à jour, y compris MMMU 2024.3, introduit des questions nouvelles ou révisées pour suivre le rythme des avancées rapides des grands modèles de langage et des systèmes multimodaux, garantissant que le benchmark reste exigeant et pertinent.
Le benchmark MMMU a été initialement introduit pour répondre au besoin d'une évaluation rigoureuse des systèmes d'IA multimodaux, qui combinent des architectures de réseaux de neurones pour traiter des informations visuelles et textuelles. La mise à jour 2024.3 se concentre spécifiquement sur le raffinement de la difficulté des questions, la réduction des fuites de données et l'ajout de nouveaux exemples qui testent les capacités émergentes en IA générative et en raisonnement. À la date de la sortie, MMMU 2024.3 sert de référence standard pour les chercheurs et les développeurs comparant les performances de modèles provenant d'organisations telles que OpenAI, Anthropic et Google DeepMind, ainsi que d'institutions académiques comme Stanford AI Lab et BAIR (Berkeley AI Research).
Structure du benchmark
MMMU 2024.3 se compose de questions à choix multiples issues de six disciplines principales : Art et design, Affaires, Sciences humaines, Sciences, Santé et médecine, et Sciences sociales. Chaque question comprend une image (telle qu'un graphique, un diagramme ou une photographie) et un prompt textuel, exigeant que le modèle intègre des informations visuelles et textuelles pour sélectionner la bonne réponse parmi quatre options. Les questions sont conçues pour être de niveau universitaire, nécessitant souvent un raisonnement en plusieurs étapes et des connaissances spécifiques au domaine. La mise à jour comprend environ 11 500 questions dans toutes les disciplines, avec une distribution similaire aux versions précédentes mais avec un contenu révisé pour résoudre les problèmes identifiés dans les itérations antérieures.
Méthodologie d'évaluation
Les modèles sont évalués sur MMMU 2024.3 en utilisant la précision comme métrique principale, avec des résultats rapportés pour l'ensemble du jeu de données et pour les sous-ensembles par discipline. Le benchmark est conçu pour être utilisé dans un cadre zero-shot, où les modèles reçoivent la question et l'image sans aucun entraînement supplémentaire ni ajustement fin sur le jeu de données. Cette approche garantit que la performance reflète les capacités inhérentes de compréhension et de raisonnement multimodal du modèle. En pratique, les chercheurs utilisent souvent le benchmark pour comparer des variantes de modèles, telles que celles avec différentes architectures de transformeurs ou régimes d'entraînement, et pour suivre les progrès au fil du temps. La mise à jour 2024.3 inclut également un ensemble de validation pour le réglage des hyperparamètres et un ensemble de test pour l'évaluation finale, avec les réponses de l'ensemble de test gardées privées pour éviter le surapprentissage.
Changements dans la version 2024.3
La mise à jour 2024.3 a introduit plusieurs changements clés. Premièrement, elle a supprimé les questions qui étaient devenues publiquement disponibles ou qui avaient des réponses ambiguës, les remplaçant par de nouvelles questions plus rigoureuses. Deuxièmement, elle a ajouté une nouvelle catégorie de questions nécessitant un raisonnement temporel, comme l'interprétation de données de séries chronologiques ou la compréhension de séquences d'événements. Troisièmement, elle a augmenté la proportion de questions impliquant des diagrammes complexes, tels que des figures scientifiques et des plans architecturaux, pour mieux tester la compréhension spatiale. Enfin, la mise à jour a amélioré la qualité des explications de réponses, fournies pour l'ensemble de validation, afin d'aider à l'analyse des erreurs. Ces changements ont été apportés en réponse aux retours de la communauté de recherche et pour garantir que le benchmark reste une mesure fiable des performances de pointe.
Impact et réception
MMMU 2024.3 a été largement adopté par la communauté de recherche en IA comme un benchmark standard pour la compréhension multimodale. Il a été utilisé dans de nombreux articles de recherche et rapports techniques pour évaluer des modèles tels que GPT-4V, Claude 3 et Gemini, avec des résultats souvent cités dans les médias. La difficulté et l'étendue du benchmark en ont fait un indicateur clé des progrès en apprentissage profond et en apprentissage automatique. Cependant, certains chercheurs ont noté que le benchmark pourrait ne pas capturer pleinement le raisonnement multimodal du monde réel, car il repose sur des questions à choix multiples et des images statiques. Malgré cela, MMMU 2024.3 reste l'un des benchmarks les plus complets et les plus exigeants disponibles, et ses mises à jour sont suivies de près par ceux qui travaillent sur les systèmes d'IA multimodaux.
Orientations futures
Alors que les modèles d'IA continuent de s'améliorer, le benchmark MMMU devrait évoluer davantage. Les futures mises à jour pourraient intégrer des éléments vidéo ou interactifs, et pourraient s'étendre à davantage de disciplines ou à des tâches de raisonnement plus nuancées. Les mainteneurs du benchmark, affiliés à des institutions telles que université de Toronto et université Carnegie-Mellon, ont indiqué un engagement à effectuer des mises à jour régulières pour suivre le rythme des avancées technologiques. La mise à jour 2024.3 témoigne de cet effort continu, fournissant un outil d'évaluation rigoureux et à jour pour la communauté de l'IA.