MathQA est un jeu de données à grande échelle introduit en 2019 par des chercheurs d'Amazon et de l'Université de Californie à Santa Barbara. Il contient 37 000 problèmes de mathématiques en anglais, présentés sous forme de questions à choix multiples, couvrant des sujets tels que les mathématiques générales, la physique et la finance. Chaque problème est annoté avec un programme linéaire qui spécifie la séquence d'opérations nécessaires pour arriver à la bonne réponse. Le jeu de données a été créé pour remédier aux limitations des jeux de données antérieurs, comme le prédécesseur de MathQA, qui se concentrait sur des calculs arithmétiques plus simples, et pour soutenir la recherche en intelligence artificielle et en apprentissage automatique pour le raisonnement mathématique.
Les problèmes de MathQA sont dérivés du jeu de données AQuA, mais sont ré-annotés avec des programmes d'opérations plus détaillés et plus cohérents. Les annotations incluent une explication textuelle, un programme linéaire formel et la réponse finale. Les programmes linéaires sont exprimés dans un langage spécifique au domaine qui inclut des opérations telles que l'addition, la soustraction, la multiplication, la division et les comparaisons. Cette structure permet aux modèles d'apprendre non seulement la réponse finale, mais aussi les étapes de raisonnement intermédiaires.
Structure du jeu de données
Chaque entrée de MathQA se compose d'un énoncé de problème, d'options à choix multiples, de la bonne réponse et d'un programme linéaire. Le programme linéaire est une séquence d'étapes, chacune impliquant un opérateur et ses arguments. Par exemple, un problème sur le calcul des intérêts simples pourrait avoir des étapes qui multiplient le capital par le taux, puis par la durée. Le jeu de données est divisé en ensembles d'entraînement (29 837 problèmes), de validation (4 469 problèmes) et de test (2 985 problèmes). Les problèmes sont classés en 33 types distincts, tels que « taux d'intérêt » ou « physique », ce qui aide à analyser les performances des modèles dans différents domaines de raisonnement.
Les programmes linéaires sont conçus pour être exécutables, ce qui signifie qu'un interpréteur de programme peut calculer la réponse à partir des nombres donnés. Cette propriété permet l'utilisation de techniques de synthèse et d'exécution de programmes dans l'entraînement et l'évaluation des modèles. Le jeu de données comprend également un ensemble de 50 000 problèmes non étiquetés pour l'apprentissage semi-supervisé, bien que le benchmark principal utilise la division étiquetée.
Évaluation et benchmarks
MathQA est couramment utilisé comme benchmark pour évaluer les capacités de raisonnement mathématique des modèles d'IA. La métrique d'évaluation standard est la précision sur l'ensemble de test, où un modèle doit produire la bonne option de réponse. Les premières lignes de base utilisant des modèles séquence-à-séquence et des réseaux neuronaux à mémoire augmentée ont atteint des précisions d'environ 30 à 40 %. Des approches plus récentes, y compris celles basées sur les architectures transformers et les grands modèles de langage, ont considérablement amélioré les performances. Par exemple, des versions affinées de modèles comme GPT-3 ont atteint des précisions supérieures à 80 % sur l'ensemble de test.
Le jeu de données est également utilisé pour évaluer la capacité des modèles à générer des étapes de raisonnement interprétables. Étant donné que les programmes linéaires sont fournis, les chercheurs peuvent mesurer non seulement si la réponse finale est correcte, mais aussi si le programme prédit correspond à la vérité terrain. Cela a conduit au développement de modèles qui combinent la génération de programmes avec l'exécution, améliorant à la fois la précision et l'interprétabilité.
Jeux de données et tâches connexes
MathQA fait partie d'une famille plus large de jeux de données de problèmes de mathématiques, notamment MAWPS, ASDiv et GSM8K. Par rapport à ceux-ci, MathQA offre un plus grand nombre de problèmes et des exigences de raisonnement plus complexes, car de nombreux problèmes impliquent plusieurs étapes et une gamme plus large d'opérations mathématiques. Le jeu de données est souvent utilisé en conjonction avec d'autres ressources pour entraîner et évaluer des modèles pour le traitement du langage naturel et le apprentissage profond.
La tâche de résolution de problèmes de mathématiques est considérée comme un test difficile de compréhension et de raisonnement machine. Elle nécessite de comprendre la description textuelle, d'extraire les quantités pertinentes et d'appliquer les opérations arithmétiques ou algébriques appropriées. Le schéma d'annotation de MathQA, avec des programmes d'opérations explicites, fournit une approche structurée de cette tâche et a influencé la conception de jeux de données ultérieurs.
Limitations et controverses
Une limitation notable de MathQA est que certains des programmes annotés contiennent des erreurs ou des incohérences, ce qui peut induire les modèles en erreur pendant l'entraînement. Les chercheurs ont identifié des problèmes tels que l'utilisation incorrecte d'opérateurs ou des étapes manquantes. De plus, le format à choix multiples du jeu de données peut permettre aux modèles d'exploiter des schémas de réponses plutôt que de réellement effectuer un raisonnement. Certaines études ont montré que les modèles peuvent atteindre une précision supérieure au hasard en utilisant des indices superficiels, comme la longueur des options ou la présence de certains nombres.
Une autre critique est que les problèmes sont relativement étroits dans leur portée, se concentrant sur l'arithmétique et l'algèbre simple, et peuvent ne pas capturer pleinement la diversité du raisonnement mathématique. Malgré ces problèmes, MathQA reste un benchmark largement utilisé pour évaluer et développer des systèmes d'IA dotés de capacités de résolution de problèmes mathématiques.
Voir aussi
- raisonnement mathématique
- réponse à des questions
- compréhension du langage naturel
- synthèse de programmes
- benchmark (informatique)
Références
- Amini, A., Gabriel, S., Lin, S., Koncel-Kedziorski, R., Choi, Y., & Hajishirzi, H. (2019). MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms. Dans les actes de NAACL-HLT.
- Le jeu de données MathQA est disponible à l'adresse https://math-qa.github.io/ (consulté en 2025).