MMLU-Pro est un ensemble de données de référence pour évaluer les capacités de connaissance et de raisonnement des grands modèles de langage. Il étend le benchmark original Massive Multitask Language Understanding (MMLU), introduit en 2020 pour mesurer les performances des modèles sur un large éventail de sujets, des sciences humaines aux domaines STEM. MMLU-Pro a été publié en novembre 2024 par une équipe de chercheurs de l'Université de Waterloo et de l'Université de Toronto, et il est rapidement devenu un point de référence standard pour comparer les systèmes d'IA de pointe.
La motivation principale derrière MMLU-Pro était de remédier aux limitations du MMLU original. À mesure que les modèles s'amélioraient, leurs scores sur MMLU ont commencé à saturer, rendant difficile la différenciation entre les systèmes les plus performants. MMLU-Pro introduit plusieurs changements clés : il inclut plus de choix de réponses par question (dix au lieu de quatre), filtre les questions trop faciles ou pouvant être résolues par simple correspondance de motifs, et ajoute une plus grande proportion de questions nécessitant un raisonnement en plusieurs étapes. L'ensemble de données contient plus de 12 000 questions réparties sur 14 domaines, notamment la physique, le droit, la psychologie et l'informatique, avec un accent sur des tâches plus complexes et axées sur le raisonnement.
Conception et construction
La construction de MMLU-Pro a impliqué un pipeline en plusieurs étapes. Les chercheurs ont commencé avec les questions du MMLU original et les ont augmentées avec des questions supplémentaires provenant d'autres sources, telles que des examens professionnels et des manuels académiques. Ils ont ensuite utilisé une combinaison de filtrage automatisé et d'annotation humaine pour éliminer les questions ambiguës ou triviales. Plus précisément, ils ont utilisé un grand modèle de langage pour générer des questions candidates, puis ont fait vérifier et affiner ces questions par des experts humains. L'ensemble de données final a été organisé pour garantir que chaque question a une réponse claire et sans ambiguïté et que le niveau de difficulté est significativement plus élevé que celui du MMLU original.
Une caractéristique notable de MMLU-Pro est l'utilisation de dix choix de réponses par question, ce qui réduit la probabilité qu'un modèle devine correctement par hasard (de 25 % dans le format original à quatre choix à 10 %). Ce choix de conception rend le benchmark plus discriminant, ce qui signifie que de petites différences dans les capacités des modèles sont plus susceptibles de se refléter dans les différences de scores. L'ensemble de données comprend également un sous-ensemble « difficile », MMLU-Pro/Reasoning, qui se concentre exclusivement sur des questions nécessitant des étapes de raisonnement explicites, telles que des problèmes mathématiques sous forme de texte et des déductions logiques.
Évaluation et impact
MMLU-Pro a été largement adopté par les chercheurs académiques et les laboratoires industriels. Les principaux développeurs d'IA, y compris OpenAI, Anthropic et Google DeepMind, ont rapporté des scores MMLU-Pro pour leurs modèles phares. Par exemple, GPT-4o d'OpenAI et Claude 3.5 Sonnet d'Anthropic ont tous deux été évalués sur MMLU-Pro, avec des scores généralement dans la plage de 70 à 80 %, par rapport à la performance d'experts humains estimée autour de 80 à 90 % sur les mêmes questions. Le benchmark a également été utilisé pour suivre les progrès des systèmes de Generative AI, et il est devenu une métrique courante dans les annonces de lancement de modèles et les rapports techniques.
L'introduction de MMLU-Pro a influencé le domaine plus large de l'évaluation de l'Artificial intelligence. Elle a suscité des discussions sur la nécessité de benchmarks plus robustes capables de suivre le rythme des améliorations rapides des capacités des modèles. Contrairement aux benchmarks antérieurs qui se concentraient sur la mémorisation ou le rappel simple, MMLU-Pro met l'accent sur le raisonnement et la résolution de problèmes, s'alignant sur les objectifs de la recherche en Machine learning pour construire des modèles capables de généraliser au-delà des données d'entraînement. Le benchmark a également été utilisé pour étudier des phénomènes tels que le apprentissage par renforcement à partir de retours humains et son effet sur les performances de raisonnement.
Comparaison avec d'autres benchmarks
MMLU-Pro est souvent comparé à d'autres suites d'évaluation comme l'AI2 Reasoning Challenge (ARC), HellaSwag et les tâches Big-Bench Hard (BBH). Alors qu'ARC et HellaSwag se concentrent sur le raisonnement de bon sens et la prédiction de texte, MMLU-Pro couvre une gamme plus large de sujets académiques, ce qui le rend plus complet pour évaluer les connaissances générales. BBH, qui est un sous-ensemble de la suite BIG-bench, comprend 23 tâches difficiles, mais le format structuré et à choix multiples de MMLU-Pro le rend plus facile à administrer et à noter de manière cohérente. En pratique, les scores MMLU-Pro corrèlent fortement avec d'autres benchmarks axés sur le raisonnement, mais il offre une vue plus granulaire des forces et des faiblesses d'un modèle à travers différents domaines.
Une limitation de MMLU-Pro est qu'il s'agit d'un benchmark statique, ce qui signifie qu'une fois que les modèles sont entraînés sur des questions similaires, leurs scores peuvent ne pas refléter une véritable généralisation. Pour atténuer cela, les chercheurs ont publié une version avec des questions réservées qui ne sont pas publiquement disponibles, permettant une évaluation plus fiable dans des environnements contrôlés. De plus, le benchmark a été critiqué pour une contamination potentielle, où les modèles pourraient avoir vu les questions pendant le pré-entraînement, bien que les auteurs aient pris des mesures pour minimiser cela en puisant les questions dans des examens et manuels moins courants.
Directions futures
Le succès de MMLU-Pro a stimulé des efforts pour créer des benchmarks encore plus difficiles. Les chercheurs explorent des moyens d'incorporer la génération dynamique de questions, où de nouvelles questions sont créées à la volée, et d'inclure des éléments multimodaux, tels que des diagrammes et des graphiques, courants dans la résolution de problèmes du monde réel. Il y a également un intérêt pour le développement de benchmarks qui mesurent non seulement l'exactitude, mais aussi l'efficacité et l'interprétabilité du raisonnement des modèles. Alors que les modèles de Deep learning continuent d'évoluer, des benchmarks comme MMLU-Pro resteront probablement des outils essentiels pour mesurer les progrès et guider la recherche future sur les architectures de réseaux de neurones et les méthodes d'entraînement.
En résumé, MMLU-Pro représente une avancée significative dans l'évaluation des grands modèles de langage, offrant une mesure plus rigoureuse et nuancée de leurs capacités. Son accent sur des questions plus difficiles et le raisonnement en a fait une référence standard dans le domaine, et son influence est susceptible de persister à mesure que les systèmes d'IA deviennent plus avancés.