Le jeu de données MATH est une collection de référence de 12 500 problèmes de mathématiques issus de compétitions de niveau lycée, notamment les American Mathematics Competitions (AMC), l'American Invitational Mathematics Examination (AIME) et le Mathematical Olympiad Program. Il a été introduit en 2021 par des chercheurs d'OpenAI pour évaluer les capacités de raisonnement mathématique des grands modèles de langage et d'autres systèmes d'IA. Chaque problème est accompagné d'une solution étape par étape et est classé dans l'une des sept catégories de sujets : algèbre, dénombrement et probabilités, géométrie, algèbre intermédiaire, théorie des nombres, préalgèbre et précalcul. Le jeu de données est largement utilisé comme référence standard pour mesurer les progrès en résolution automatisée de problèmes mathématiques, en particulier pour les modèles basés sur transformers.
Le jeu de données a été créé pour remédier aux limitations des références antérieures qui se concentraient sur l'arithmétique simple ou la reconnaissance de formes. Les problèmes du jeu de données MATH exigent un raisonnement en plusieurs étapes, une manipulation symbolique et une compréhension des concepts mathématiques, ce qui en fait un test difficile pour les systèmes d'IA. Les problèmes sont présentés au format LaTeX, et les solutions sont rédigées dans un style de langage naturel, permettant aux modèles de générer à la fois des réponses finales et un raisonnement explicatif. Le jeu de données est accessible au public et a été utilisé dans de nombreuses études de recherche pour comparer les performances de différentes architectures de modèles et approches d'entraînement.
Conception et structure
Le jeu de données MATH se compose de 12 500 problèmes, répartis en un ensemble d'entraînement de 7 500 problèmes et un ensemble de test de 5 000 problèmes. Chaque problème est étiqueté avec un niveau de difficulté allant de 1 à 5, où le niveau 1 représente les problèmes les plus faciles et le niveau 5 les plus difficiles. Le jeu de données couvre sept domaines de sujets distincts, chaque problème étant attribué à exactement une catégorie. Les problèmes sont tirés de compétitions réelles, garantissant qu'ils ne sont pas triviaux et exigent une véritable perspicacité mathématique. Les solutions fournies sont rédigées par des humains et servent de réponses de référence pour évaluer les sorties des modèles.
Le jeu de données a été conçu pour tester non seulement la réponse finale, mais aussi le processus de raisonnement. Lors de l'évaluation, les modèles sont généralement invités à produire une réponse finale dans un format spécifique, et leurs réponses sont comparées à la vérité de référence. Certains protocoles d'évaluation évaluent également la qualité des étapes de raisonnement générées, bien que cela soit moins standardisé. Les niveaux de difficulté permettent aux chercheurs d'analyser les performances des modèles sur différentes gammes de complexité, révélant les forces et les faiblesses dans des domaines spécifiques des mathématiques.
Évaluation et performances
Les évaluations initiales utilisant le jeu de données MATH ont montré que les modèles contemporains obtenaient de mauvais résultats, avec des taux de précision inférieurs à 10 % sur l'ensemble de test complet. Par exemple, GPT-3, un grand modèle de langage développé par OpenAI, n'atteignait qu'environ 5 % de précision sur le jeu de données, soulignant la difficulté des problèmes. Les modèles ultérieurs, tels que ceux utilisant des techniques de apprentissage profond et des architectures de réseaux de neurones, se sont considérablement améliorés, mais même les systèmes de pointe en 2024 peinent encore avec les problèmes les plus difficiles. Le jeu de données est devenu une référence clé dans le domaine, de nombreux articles de recherche rapportant des résultats dessus pour démontrer les avancées en raisonnement mathématique.
La référence a également été utilisée pour étudier l'efficacité de techniques telles que le prompt en chaîne de pensée, où les modèles sont encouragés à générer des étapes de raisonnement intermédiaires avant d'arriver à une réponse finale. Cette approche a montré une amélioration des performances sur le jeu de données MATH, en particulier pour les modèles plus grands. De plus, le jeu de données a été utilisé pour évaluer l'impact de l'entraînement sur des données synthétiques, de l'apprentissage par renforcement et d'autres méthodes visant à améliorer les capacités de raisonnement.
Impact et utilisation
Le jeu de données MATH a eu un impact significatif sur le développement de systèmes d'IA pour la résolution de problèmes mathématiques. Il a été adopté par de grandes organisations de recherche, notamment Google DeepMind, Anthropic, et des institutions académiques comme MIT CSAIL et Stanford AI Lab. Le jeu de données est souvent utilisé en conjonction avec d'autres références, telles que GSM8K, pour fournir une évaluation complète des compétences mathématiques. Il a également été intégré dans des pipelines d'entraînement, où les modèles sont affinés sur l'ensemble d'entraînement pour améliorer leurs performances sur les tâches mathématiques.
Le jeu de données a stimulé la création de références dérivées et d'extensions, telles que MATH-500, un sous-ensemble de 500 problèmes utilisé pour une évaluation plus rapide, et MATH-SHEPHERD, qui se concentre sur la vérification des solutions générées par les modèles. Ces extensions ont encore élargi l'utilité du jeu de données original. Le jeu de données MATH est également utilisé dans des contextes éducatifs, où il sert de ressource pour tester les systèmes de tutorat en IA et les outils de notation automatisée.
Limitations et critiques
Malgré son utilisation répandue, le jeu de données MATH a fait face à certaines critiques. Une limitation est que les problèmes sont tirés exclusivement de compétitions de mathématiques occidentales, ce qui peut introduire un biais culturel. De plus, le jeu de données est statique, ce qui signifie que les modèles peuvent potentiellement mémoriser les solutions s'ils sont entraînés sur les mêmes problèmes, bien que la difficulté des problèmes rende cela moins préoccupant. Certains chercheurs ont noté que le jeu de données se concentre sur la manipulation symbolique et peut ne pas capturer pleinement l'étendue du raisonnement mathématique, comme l'intuition géométrique ou la résolution de problèmes du monde réel. En 2025, des efforts sont en cours pour créer des références plus diverses et dynamiques qui remédient à ces limitations.
Voir aussi
Références
Le jeu de données MATH a été introduit dans l'article « Measuring Mathematical Problem Solving With the MATH Dataset » de Dan Hendrycks et ses collègues, publié en 2021. Le jeu de données est disponible en téléchargement sur le dépôt GitHub d'OpenAI et est sous licence permissive pour une utilisation en recherche.