BIG-Bench Hard (BBH) est un sous-ensemble de 23 tâches sélectionnées à partir du benchmark plus large BIG-Bench, introduit en 2022 par des chercheurs de Google et d'autres institutions. Ce sous-ensemble a été créé pour se concentrer sur des tâches particulièrement difficiles pour les grands modèles de langage, notamment celles où les modèles de moins de 12 milliards de paramètres obtiennent de mauvais résultats. BBH est conçu pour mesurer la capacité d'un modèle à gérer un raisonnement complexe, une résolution de problèmes en plusieurs étapes, et des tâches qui nécessitent une compréhension plus profonde au-delà du simple appariement de motifs.
Le benchmark est issu de l'effort plus large BIG-Bench, qui comprenait plus de 200 tâches contribuées par plus de 450 chercheurs issus de 130 institutions. Le processus de sélection pour BBH impliquait d'identifier les tâches où l'écart de performance entre les petits et les grands modèles était significatif, et où les évaluateurs humains jugeaient que les tâches exigeaient un raisonnement substantiel. L'ensemble final de 23 tâches inclut des problèmes dans des domaines tels que les expressions booléennes, le jugement causal, la compréhension de dates, la désambiguïsation, et les formes géométriques, entre autres.
Sélection des tâches et caractéristiques
Les 23 tâches de BBH ont été choisies sur la base de deux critères principaux : elles devaient être des tâches où les meilleurs modèles disponibles à l'époque obtenaient un score inférieur à un certain seuil (spécifiquement, inférieur à la performance moyenne des évaluateurs humains), et elles devaient être des tâches qui n'étaient pas facilement résolubles par des heuristiques simples. Ce processus de sélection a abouti à un benchmark notablement plus difficile que la suite complète de BIG-Bench, avec une performance moyenne des modèles chutant significativement lorsqu'elle est évaluée sur BBH seul.
Chaque tâche de BBH est conçue pour tester une compétence cognitive spécifique. Par exemple, la tâche 'expressions booléennes' nécessite d'évaluer des déclarations logiques complexes, tandis que 'jugement causal' demande aux modèles de déterminer des relations de cause à effet dans des scénarios hypothétiques. D'autres tâches incluent 'hyperbaton' (identifier des phrases grammaticalement correctes), 'déduction logique' (résoudre des puzzles logiques en plusieurs étapes), et 'tri de mots' (arranger des mots par ordre alphabétique sous contraintes).
Méthodologie d'évaluation
BBH est généralement évalué en utilisant une approche de prompting en quelques exemples, où les modèles reçoivent un petit nombre d'exemples (généralement trois à cinq) avant de devoir résoudre de nouveaux problèmes. Le benchmark inclut un ensemble spécifique de prompts et de scripts d'évaluation qui standardisent le processus de test. Dans l'article original, les auteurs ont évalué plusieurs grands modèles de langage, y compris ceux de Google et d'OpenAI, et ont constaté que même les plus grands modèles rencontraient des difficultés avec de nombreuses tâches.
Un résultat notable était que l'utilisation du prompting en chaîne de pensée, où le modèle est encouragé à montrer ses étapes de raisonnement, améliorait significativement la performance sur les tâches BBH. Cette technique, développée en parallèle de BBH, permettait aux modèles de décomposer des problèmes complexes en étapes plus petites et plus gérables. La combinaison de BBH et du prompting en chaîne de pensée est devenue une méthode d'évaluation standard pour évaluer les capacités de raisonnement dans les modèles ultérieurs.
Impact et utilisation
BBH est devenu un benchmark largement utilisé dans la communauté de recherche sur les grands modèles de langage. Il est souvent cité dans les articles qui présentent de nouveaux modèles ou techniques d'entraînement, servant de mesure des capacités de raisonnement d'un modèle au-delà de la simple compréhension du langage. Le benchmark a été particulièrement utile pour suivre les progrès dans le développement des modèles, car les améliorations des scores BBH corrèlent souvent avec des améliorations dans d'autres tâches nécessitant un raisonnement poussé.
Plusieurs grandes organisations de recherche en IA, y compris OpenAI et Google DeepMind, ont utilisé BBH dans le cadre de leurs suites d'évaluation internes. Le benchmark a également été intégré dans des cadres d'évaluation plus larges, tels que le projet HELM (évaluation holistique des modèles de langage), qui agrège plusieurs benchmarks pour fournir une vue complète des capacités des modèles. En 2025, BBH reste une référence standard pour comparer les performances de raisonnement entre différentes architectures et tailles de modèles.
Limites et critiques
Malgré sa popularité, BBH a fait face à certaines critiques. Certains chercheurs soutiennent que le benchmark peut ne pas pleinement capturer le raisonnement du monde réel, car les tâches sont souvent abstraites et déconnectées des applications pratiques. D'autres ont noté que les modèles peuvent parfois 'contourner' le benchmark en mémorisant des motifs à partir des données d'entraînement, bien que les auteurs de BBH aient pris des mesures pour minimiser cela en utilisant des tâches qui n'étaient pas largement disponibles en ligne.
De plus, la focalisation du benchmark sur des tâches en anglais limite son applicabilité aux modèles multilingues. Alors que le BIG-Bench original incluait certaines tâches multilingues, BBH est exclusivement en anglais, ce qui peut désavantager les modèles principalement entraînés sur d'autres langues. Malgré ces limitations, BBH continue d'être un outil précieux pour comprendre les capacités et les limites des systèmes d'IA actuels.
Benchmarks connexes et orientations futures
Le développement de BBH a inspiré des efforts similaires, tels que le benchmark MMLU (Massive Multitask Language Understanding) et l'ARC (AI2 Reasoning Challenge). Ces benchmarks, avec BBH, forment une suite de tests qui évaluent collectivement les capacités de connaissance, de raisonnement et de résolution de problèmes d'un modèle. À mesure que les modèles continuent de s'améliorer, il existe un travail continu pour créer des benchmarks encore plus difficiles capables de différencier les systèmes les plus performants.
Les futures itérations de BBH pourraient incorporer des tâches plus dynamiques, où les problèmes sont générés à la volée pour empêcher la mémorisation. Il y a également un intérêt pour étendre BBH à un raisonnement multimodal, où les modèles doivent intégrer des informations provenant de textes, d'images et d'autres types de données. Ces développements maintiendront probablement la pertinence de BBH alors que le domaine de l'intelligence artificielle continue d'évoluer.