Traduit de l'anglais

MMLU (Massive Multitask Language Understanding) est un benchmark de 2020 testant les modèles de langage à travers 57 matières académiques et professionnelles à l'aide de questions à choix multiples, largement utilisé pour mesurer les connaissances générales jusqu'à ce que les performances atteignent un plateau.

MMLU, abréviation de Massive Multitask Language Understanding, est un repère introduit en 2020 par Dan Hendrycks et ses collaborateurs pour mesurer l'étendue des connaissances et la capacité de raisonnement des modèles de langage. Il comprend environ 15 900 questions à choix multiples couvrant 57 sujets, notamment les mathématiques élémentaires, l'histoire des États-Unis, l'informatique, le droit et la médecine professionnelle, tirées en grande partie d'examens et de manuels réels, avec une difficulté allant du niveau élémentaire au niveau professionnel et expert.

Conception et objectif

MMLU a été conçu pour tester le type de connaissances générales du monde qu'un modèle devrait acquérir principalement grâce au pré-entraînement sur de grands corpus de texte, plutôt que par un ajustement fin spécifique à une tâche, ce qui en fait un indicateur de la quantité de connaissances d'un modèle à travers les disciplines plutôt que de sa performance sur une seule tâche étroite. Son créateur, Dan Hendrycks, est devenu plus tard un chercheur éminent en sécurité de l'IA et a fondé le Center for AI Safety, et la construction de MMLU reflétait un effort précoce pour faire évoluer l'évaluation des LLM au-delà des repères étroits comme la compréhension de lecture ou les questions-réponses dans un domaine unique, vers quelque chose de plus proche de la connaissance générale.

Adoption

Après sa publication à l'époque de GPT-3 et des grands modèles de langage ultérieurs, MMLU est devenu l'un des repères les plus largement rapportés dans les articles de présentation de modèles et les rapports techniques, cité par pratiquement tous les grands laboratoires, y compris OpenAI, Anthropic, Google DeepMind et Meta AI, comme une métrique de capacité phare. Son omniprésence en a fait un point de comparaison courant entre des modèles entraînés par différentes organisations utilisant différentes méthodes, remplissant un rôle similaire à celui qu'ImageNet avait joué pour la vision par ordinateur une décennie plus tôt.

Saturation

Les premiers modèles de langage obtenaient des scores à peine supérieurs aux 25 % attendus d'une devinette aléatoire sur des questions à quatre options, mais les performances ont rapidement augmenté à mesure que les modèles étaient mis à l'échelle : les modèles ont dépassé 80 % en quelques années, et d'ici 2024, les principaux modèles de pointe ont dépassé 90 %, approchant les estimations du score qu'un panel d'experts humains pourrait atteindre. Cette saturation a réduit la capacité de MMLU à distinguer les meilleurs modèles et a conduit à la création de repères successeurs plus difficiles, notamment MMLU-Pro, qui a ajouté des questions plus difficiles et élargi les choix de réponses pour réduire l'impact des devinettes.

Critiques

MMLU a suscité des critiques sur plusieurs points : les chercheurs ont identifié un taux non négligeable de questions ou de clés de réponses erronées ou ambiguës dans le jeu de données original ; comme il s'appuie sur des supports d'examen accessibles au public, la contamination des données est une préoccupation persistante, car certaines questions ou quasi-duplicatas apparaissent probablement dans les données à l'échelle du web utilisées pour pré-entraîner de nombreux modèles ; et le format à choix multiples récompense la reconnaissance plutôt que la génération, ce qui peut ne pas refléter la manière dont les modèles sont réellement utilisés dans des tâches ouvertes. Certains de ces problèmes ont été partiellement résolus dans des variantes ultérieures, mais la conception centrale de MMLU reste un instantané des priorités d'évaluation de l'ère 2020.

Héritage

Malgré la saturation et les critiques, MMLU reste largement cité comme point de référence de base dans les comparaisons de modèles et continue d'apparaître dans les annonces de publication même après avoir cessé de différencier de manière significative les modèles de premier plan, illustrant un schéma plus large dans lequel des repères influents persistent comme un vocabulaire commun longtemps après que leur pouvoir discriminatif s'est estompé.

Catégories:ai-evaluation·natural-language-processing
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique