BIG-bench 2023 est l'édition révisée du benchmark Beyond the Imitation Game, un effort collaboratif initié en 2021 pour évaluer les capacités et les limites des grands modèles de langage. Le BIG-bench original comprenait 204 tâches contribuées par plus de 450 chercheurs issus de 130 institutions, conçues pour sonder des compétences souvent négligées par les benchmarks standards, telles que le raisonnement causal, les connaissances de sens commun et la résolution de problèmes mathématiques. La mise à jour de 2023, publiée au début de l'année 2023, s'appuie sur cette base en ajoutant de nouvelles tâches, en affinant les métriques d'évaluation et en élargissant la liste des modèles testés, en se concentrant particulièrement sur le paysage en évolution rapide des systèmes d'IA générative.
L'objectif principal du benchmark est de fournir un étalon rigoureux et standardisé pour mesurer les progrès en intelligence artificielle, en particulier pour les grands modèles de langage. Contrairement aux benchmarks antérieurs qui se concentraient sur des tâches étroites comme la réponse à des questions ou l'analyse de sentiments, BIG-bench 2023 inclut des tâches nécessitant un raisonnement en plusieurs étapes, des connaissances du monde et même de l'écriture créative. Il met également l'accent sur la mesure de la calibration des modèles (dans quelle mesure la confiance correspond à la précision) et la robustesse face aux entrées adverses. La version 2023 a introduit un sous-ensemble de tâches désigné sous le nom de « BIG-bench Hard » (BBH), comprenant 23 tâches où les modèles précédents performaient au niveau ou en dessous de celui des évaluateurs humains moyens, servant ainsi d'obstacle difficile pour le développement futur.
Structure et catégories de tâches
BIG-bench 2023 organise ses tâches en plusieurs grandes catégories, chacune ciblant un aspect différent des compétences des modèles. Celles-ci incluent :
- Raisonnement : Tâches impliquant la déduction logique, l'inférence causale et l'arithmétique en plusieurs étapes. Des exemples incluent « causal_judgement » et « logical_deduction » (avec trois à cinq objets).
- Connaissances : Questions sondant les connaissances factuelles du monde, telles que « periodic_elements » ou « international_phonetic_alphabet_transliterate ».
- Biais sociaux et équité : Tâches comme « bbq_lite » et « gender_bias » qui évaluent si les modèles présentent des stéréotypes nuisibles.
- Compréhension du langage : Tâches sur la sémantique, la syntaxe et la pragmatique, telles que « linguistics_puzzles » et « novel_concepts ».
- Mathématiques : Problèmes nécessitant une manipulation symbolique et de l'arithmétique, y compris « mathematical_induction » et « number_sequence ».
- Sens commun : Tâches comme « physical_intuition » et « social_support » qui testent le raisonnement quotidien.
Chaque tâche comprend une invite, un ensemble de réponses possibles et une métrique de notation (généralement la correspondance exacte ou la précision à choix multiples). La mise à jour de 2023 a ajouté plusieurs nouvelles tâches dans des domaines comme la génération de code et la compréhension multilingue, reflétant l'importance croissante de ces compétences dans les applications réelles.
Méthodologie d'évaluation et métriques
BIG-bench 2023 utilise un protocole d'évaluation standardisé pour garantir la comparabilité entre les modèles. Les modèles sont sollicités avec l'entrée de chaque tâche, et leurs sorties sont notées à l'aide de métriques spécifiques à la tâche. La métrique agrégée principale est la précision normalisée moyenne sur toutes les tâches, où le score de chaque tâche est normalisé de sorte que le hasard donne 0 et une performance parfaite donne 1. Cela permet d'obtenir un nombre unique résumant la capacité globale.
La version 2023 a également introduit des évaluations « ciblées », où les modèles sont testés sur des sous-ensembles de tâches particulièrement difficiles ou pertinentes pour des capacités spécifiques. Par exemple, le sous-ensemble BBH est utilisé pour suivre les progrès sur des tâches auparavant non résolues. De plus, le benchmark inclut des paramètres « few-shot » (généralement 0-shot, 1-shot et 5-shot) pour mesurer la capacité d'apprentissage en contexte, et il rapporte l'erreur de calibration, qui indique dans quelle mesure les probabilités prédites par un modèle correspondent à la correction réelle.
Couverture des modèles et résultats
BIG-bench 2023 inclut des résultats d'une large gamme de modèles, des efforts open-source comme ceux de Google DeepMind et Anthropic aux systèmes propriétaires de OpenAI et d'autres. Le benchmark a été utilisé pour évaluer des modèles de tailles variées, des petits transformeurs avec des millions de paramètres aux grands modèles de langage avec des centaines de milliards. Les constatations notables incluent que la performance s'améliore généralement avec l'échelle du modèle, mais certaines tâches restent difficiles même pour les plus grands modèles, comme celles nécessitant un raisonnement logique profond ou des connaissances factuelles rares.
Par exemple, sur le sous-ensemble BBH, de nombreux modèles en 2023 obtenaient encore moins de 50 % de précision normalisée, indiquant une marge d'amélioration significative. Le benchmark a également souligné que les modèles présentent souvent une surconfiance, avec des erreurs de calibration plus élevées sur les tâches difficiles. Ces résultats ont informé la recherche sur des techniques comme RLHF (apprentissage par renforcement à partir de retours d'IA) et une meilleure curation des données d'entraînement.
Impact et réception
La mise à jour de 2023 a été largement adoptée par la communauté de recherche en IA comme une suite d'évaluation standard. Elle a été citée dans des centaines d'articles et utilisée par les grands laboratoires pour comparer leurs modèles. La nature collaborative de BIG-bench, avec des contributions d'institutions comme MIT CSAIL, Stanford AI Lab et Berkeley AI Research, a favorisé une culture de benchmarking ouvert. Les critiques ont noté que les tâches du benchmark sont statiques et peuvent devenir saturées avec le temps, mais l'inclusion de nouvelles tâches et du sous-ensemble BBH dans la version 2023 atténue cette préoccupation.
BIG-bench 2023 a également influencé le développement de benchmarks similaires, tels que HELM et MMLU, et a été utilisé pour étudier les capacités émergentes des grands modèles de langage. Ses résultats ont été essentiels pour comprendre les capacités et les limites de systèmes comme GPT-4 et Claude, et il continue de servir de point de référence pour mesurer les progrès en intelligence artificielle.
Orientations futures
En 2023, l'équipe BIG-bench a annoncé des plans pour d'autres mises à jour, y compris la génération dynamique de tâches et des formats d'évaluation plus interactifs. L'objectif est de maintenir la pertinence du benchmark à mesure que les modèles évoluent, en incorporant potentiellement des tâches nécessitant l'utilisation d'outils ou des dialogues multi-tours. La version 2023 reste un instantané des capacités de l'IA à cette époque, mais sa méthodologie et ses perspectives influenceront probablement les futurs efforts de benchmarking pendant des années à venir.