GSM8K (Grade School Math 8K) est un ensemble de données de 8 500 problèmes de mathématiques de niveau primaire, de haute qualité et linguistiquement diversifiés, créé par des chercheurs d'OpenAI et publié en 2021. Il est conçu pour évaluer les capacités de raisonnement mathématique en plusieurs étapes des grands modèles de langage (LLM). Chaque problème nécessite de deux à huit étapes pour être résolu, impliquant des opérations arithmétiques de base et des déductions logiques, avec un accent mis sur la compréhension du langage naturel plutôt que sur des connaissances mathématiques avancées.
Ce benchmark est devenu une référence standard pour évaluer les capacités de raisonnement des systèmes d'IA, en particulier dans le contexte de la recherche en intelligence artificielle. Son nom dérive de la taille de l'ensemble de données (8 500 problèmes) et de son orientation vers les mathématiques de niveau primaire. Les problèmes sont rédigés de manière à pouvoir être résolus par un élève brillant de collège, mais ils exigent souvent des modèles qu'ils effectuent des calculs séquentiels et maintiennent un état intermédiaire, ce qui représente un défi important pour les premières architectures de réseaux de neurones.
Conception et composition de l'ensemble de données
L'ensemble de données GSM8K a été construit par une équipe d'annotateurs qui ont rédigé les problèmes dans un style imitant les questions mathématiques réelles, telles que celles que l'on trouve dans les manuels scolaires ou les tests standardisés. Les problèmes couvrent des sujets comme les fractions, les pourcentages, les ratios et l'algèbre simple, mais ils sont volontairement formulés de manière à éviter les schémas stéréotypés, afin d'encourager les modèles à faire preuve d'un véritable raisonnement plutôt que de se contenter d'une reconnaissance de motifs. L'ensemble est divisé en un ensemble d'entraînement de 7 500 problèmes et un ensemble de test de 1 000 problèmes, ce dernier étant utilisé pour l'évaluation.
Chaque problème de GSM8K est accompagné d'une solution en langage naturel qui décompose le raisonnement en étapes. Ces solutions ne se limitent pas à la réponse finale ; elles incluent les calculs intermédiaires et les explications, ce qui est utile pour entraîner les modèles à générer un raisonnement pas à pas. L'ensemble de données comprend également une version distincte de 1 000 problèmes avec des solutions plus détaillées, connue sous le nom de version « chaîne de pensée » (chain-of-thought), qui a ensuite été utilisée pour étudier l'impact des techniques d'incitation (prompting).
Rôle dans l'évaluation des modèles de langage
GSM8K est rapidement devenu un benchmark incontournable pour mesurer les capacités de raisonnement des modèles basés sur transformers. Les premiers modèles de deep learning avaient du mal avec cet ensemble de données, obtenant souvent une précision inférieure à 10 %, car ils ne parvenaient pas à effectuer de manière fiable des calculs arithmétiques en plusieurs étapes. L'introduction de l'incitation par chaîne de pensée, où les modèles sont encouragés à produire des étapes de raisonnement intermédiaires avant la réponse finale, a conduit à des améliorations significatives, avec des modèles comme GPT-3 et ses versions ultérieures atteignant des scores beaucoup plus élevés.
Le benchmark a également été utilisé pour comparer les performances de modèles provenant de diverses organisations, notamment Anthropic, Google DeepMind et Meta. Il sert à étudier les limites du apprentissage automatique en matière de raisonnement mathématique, les chercheurs analysant les modes d'échec tels que les erreurs d'arithmétique, les mauvaises interprétations des énoncés et l'incapacité à gérer de grands nombres.
Impact sur la recherche en IA
GSM8K a influencé le développement de techniques visant à améliorer le raisonnement dans les LLM. Il a été déterminant pour démontrer la valeur de la montée en échelle des réseaux de neurones, car les modèles plus grands entraînés sur davantage de données ont montré des améliorations marquées sur ce benchmark. L'ensemble de données a également stimulé la recherche sur les méthodes de IA générative pour la vérification, comme l'entraînement de modèles séparés pour vérifier l'exactitude des solutions, ainsi que sur les approches de apprentissage par renforcement qui récompensent les étapes de raisonnement correctes.
Au-delà de son utilisation comme outil d'évaluation, GSM8K a été employé comme ressource d'entraînement. Certains chercheurs ont utilisé l'ensemble d'entraînement pour affiner des modèles spécifiquement pour le raisonnement mathématique, tandis que d'autres l'ont utilisé pour générer des données synthétiques en vue d'un entraînement supplémentaire. La conception de l'ensemble de données, avec son accent sur le langage naturel et les problèmes en plusieurs étapes, a également inspiré la création d'autres benchmarks, tels que MATH (un ensemble de données plus avancé) et SVAMP (une variante avec des problèmes modifiés).
Limites et critiques
Malgré sa popularité, GSM8K présente des limites. Les critiques notent que l'ensemble de données est relativement petit et peut ne pas refléter toute la complexité du raisonnement mathématique, car les problèmes se limitent au niveau primaire. De plus, les modèles peuvent parfois atteindre des scores élevés en exploitant des régularités statistiques dans les problèmes plutôt qu'en effectuant un véritable raisonnement, un phénomène connu sous le nom d'« apprentissage de raccourcis » (shortcut learning). Le benchmark ne teste pas non plus la compréhension de concepts mathématiques au-delà de l'arithmétique, comme la géométrie ou le calcul.
Une autre critique concerne le fait que les problèmes de l'ensemble de données sont rédigés en anglais et reflètent un contexte éducatif occidental, ce qui peut limiter son applicabilité à d'autres langues ou contextes culturels. Les chercheurs ont appelé à la création de benchmarks plus diversifiés pour compléter GSM8K, ce qui a conduit au développement d'ensembles de données comme MATH et GSM8K-Sym, ce dernier introduisant des variations symboliques pour tester la robustesse des modèles.
Utilisation actuelle et perspectives d'avenir
En 2025, GSM8K reste un benchmark largement utilisé dans la communauté du machine learning, souvent inclus dans les suites d'évaluation des nouveaux LLM. Il est fréquemment cité dans les articles de recherche et utilisé par les entreprises pour rendre compte des performances de leurs modèles. Cependant, à mesure que les modèles se sont améliorés, beaucoup atteignent désormais une précision supérieure à 90 % sur l'ensemble de test, ce qui amène certains à affirmer que le benchmark devient saturé. Cela a conduit à la création de versions plus difficiles, comme GSM8K-Hard, qui augmente le nombre d'étapes requises, et à l'intégration de GSM8K dans des benchmarks de raisonnement plus larges comme MMLU et BIG-bench.
L'avenir de GSM8K implique probablement son utilisation comme référence de base plutôt que comme différenciateur, les chercheurs se tournant vers des tâches de raisonnement plus complexes. Néanmoins, sa contribution au domaine est significative, car il a contribué à catalyser le développement de techniques de raisonnement en plusieurs étapes dans l'IA, qui sont désormais centrales dans de nombreuses applications de l'intelligence artificielle.