BBH 2024 est un benchmark conçu pour évaluer les grands modèles de langage (LLM) sur une série de tâches de raisonnement exigeantes. Il s'agit d'une version mise à jour du benchmark BIG-Bench Hard (BBH), qui était lui-même un sous-ensemble sélectionné de la suite plus vaste BIG-Bench. BBH 2024 a été publié en 2024 pour répondre aux limites du BBH original, notamment la saturation des performances des modèles plus récents et la nécessité de protocoles d'évaluation plus robustes.
Le benchmark se compose de 23 tâches sélectionnées à partir de BIG-Bench, identifiées comme particulièrement difficiles pour les modèles de langage. Ces tâches couvrent une gamme de capacités de raisonnement, notamment le jugement causal, la compréhension des dates, la désambiguïsation et la déduction logique. BBH 2024 introduit des prompts révisés, des formats de réponse mis à jour et une nouvelle méthodologie de notation qui pénalise plus strictement les réponses partiellement correctes que le BBH original. Le benchmark mis à jour vise à fournir une mesure plus fiable des capacités des modèles à la frontière de la recherche en IA.
Composition des tâches et sélection
Les 23 tâches de BBH 2024 sont les mêmes que celles du BBH original, mais avec des modifications significatives. Par exemple, la tâche « Causal Judgment » inclut désormais 100 scénarios contrefactuels supplémentaires, et la tâche « Date Understanding » a été élargie pour couvrir une gamme plus large de formats de calendrier. La tâche « Logical Deduction » exige désormais que les modèles produisent une séquence d'étapes de raisonnement plutôt que seulement la réponse finale. Ces changements ont été apportés pour réduire l'efficacité de la reconnaissance de motifs simples et encourager un raisonnement authentique.
Chaque tâche inclut un prompt few-shot avec 3 à 5 exemples, comme dans le BBH original. Cependant, BBH 2024 fournit des exemples mis à jour qui reflètent un usage linguistique plus récent et incluent des explications pour les réponses correctes. Le benchmark introduit également un mode d'évaluation « chain-of-thought », où les modèles sont incités à produire des étapes de raisonnement intermédiaires avant la réponse finale, et un mode « direct » sans cette incitation.
Notation et évaluation
BBH 2024 utilise un système de notation qui accorde un crédit complet uniquement pour les correspondances exactes avec la réponse de référence. Un crédit partiel est accordé pour les réponses qui contiennent la réponse finale correcte mais incluent du texte supplémentaire. Le benchmark rapporte à la fois la précision moyenne sur les tâches et l'écart type. Pour le mode chain-of-thought, la précision est calculée sur la réponse finale après les étapes de raisonnement, et une métrique distincte, « cohérence du raisonnement », est introduite pour évaluer la cohérence logique des étapes générées.
Dans le BBH original, des modèles comme GPT-3 atteignaient une précision moyenne d'environ 40 % sur les tâches. D'ici 2024, des modèles de pointe comme GPT-4 et Claude 3 ont dépassé 80 % sur le BBH original, ce qui a motivé la nécessité d'une version plus difficile. BBH 2024 inclut un nouveau « mode difficile » où les prompts sont perturbés de manière adversarial, et le benchmark rapporte les résultats pour les modes standard et difficile.
Performance des modèles et saturation
Les premiers résultats sur BBH 2024, publiés à la mi-2024, montrent que les modèles les plus performants, notamment GPT-4 Turbo et Claude 3 Opus, atteignent environ 70 % de précision moyenne en mode standard et environ 50 % en mode difficile. Cela représente une baisse significative par rapport à leur quasi-saturation sur le BBH original, indiquant que le benchmark mis à jour fournit une évaluation plus discriminante. Le benchmark a été adopté par plusieurs laboratoires de recherche en IA, notamment OpenAI, Anthropic et Google DeepMind, comme outil d'évaluation standard pour leurs modèles.
BBH 2024 inclut également une étude de « baseline humaine », où 100 participants humains ont été recrutés via une plateforme de crowdsourcing. La précision de la baseline humaine en mode standard est de 85 %, et en mode difficile de 75 %, montrant que le benchmark laisse encore une marge d'amélioration pour les systèmes d'IA.
Relation avec d'autres benchmarks
BBH 2024 fait partie d'un écosystème plus large de benchmarks en IA. Il complète d'autres suites comme MMLU (Massive Multitask Language Understanding) et HellaSwag, mais se concentre spécifiquement sur les tâches qui nécessitent un raisonnement en plusieurs étapes. Contrairement à MMLU, qui couvre une large gamme de domaines de connaissances, BBH 2024 met l'accent sur des tâches faciles pour les humains mais difficiles pour l'IA, comme défini à l'origine par BIG-Bench. La version mise à jour maintient cette philosophie tout en augmentant la difficulté et la robustesse de l'évaluation.
Le benchmark est publiquement disponible sur GitHub, et les auteurs fournissent un classement avec les résultats de divers modèles. Le classement est mis à jour régulièrement, et à la fin de 2024, la première entrée est un modèle de Google DeepMind avec une précision moyenne de 72,3 % en mode standard.
Orientations futures
Les créateurs de BBH 2024 ont indiqué qu'ils prévoient de publier des mises à jour annuelles pour suivre le rythme des améliorations des modèles. Ils explorent également l'inclusion de tâches nécessitant un raisonnement multimodal, comme l'interprétation de graphiques et de diagrammes. Le benchmark devrait rester un point de référence clé pour évaluer les capacités de raisonnement des grands modèles de langage dans un avenir prévisible.
Voir aussi
- BIG-Bench
- MMLU
- Chaîne de pensée
- Évaluation des systèmes d'IA