Traduzido do inglês

MathQA é um conjunto de dados em larga escala com 37.000 problemas matemáticos de múltipla escolha em formato de texto, acompanhados de programas de operação anotados, projetado para avaliar e melhorar as capacidades de raciocínio de sistemas de IA.

MathQA é um conjunto de dados em larga escala introduzido em 2019 por pesquisadores da Amazon e da Universidade da Califórnia, em Santa Bárbara. Ele contém 37.000 problemas de matemática em inglês, com múltipla escolha, abrangendo tópicos como matemática geral, física e finanças. Cada problema é anotado com um programa linear que especifica a sequência de operações necessárias para chegar à resposta correta. O conjunto de dados foi criado para superar as limitações de conjuntos anteriores, como o predecessor do MathQA, que focava em aritmética mais simples, e para apoiar pesquisas em inteligência artificial e aprendizado de máquina voltadas ao raciocínio matemático.

Os problemas do MathQA são derivados do conjunto AQuA, mas foram reanotados com programas operacionais mais detalhados e consistentes. As anotações incluem uma explicação textual, um programa linear formal e a resposta final. Os programas são expressos em uma linguagem de domínio específico que inclui operações como adição, subtração, multiplicação, divisão e comparações. Essa estrutura permite que os modelos aprendam não apenas a resposta final, mas também as etapas intermediárias de raciocínio.

Estrutura do Conjunto de Dados

Cada entrada no MathQA consiste em um enunciado do problema, opções de múltipla escolha, a resposta correta e um programa linear. O programa é uma sequência de etapas, cada uma envolvendo um operador e seus argumentos. Por exemplo, um problema sobre cálculo de juros simples pode ter etapas que multiplicam o principal pela taxa e depois pelo tempo. O conjunto é dividido em conjuntos de treinamento (29.837 problemas), validação (4.469 problemas) e teste (2.985 problemas). Os problemas são categorizados em 33 tipos distintos, como "taxa de juros" ou "física", o que ajuda a analisar o desempenho dos modelos em diferentes domínios de raciocínio.

Os programas lineares são projetados para serem executáveis, ou seja, um interpretador de programas pode calcular a resposta a partir dos números fornecidos. Essa propriedade possibilita o uso de técnicas de síntese e execução de programas no treinamento e na avaliação de modelos. O conjunto também inclui 50.000 problemas não rotulados para aprendizado semissupervisionado, embora a divisão principal usada como referência seja a rotulada.

Avaliação e Benchmarks

O MathQA é amplamente utilizado como referência para avaliar a capacidade de raciocínio matemático de modelos de IA. A métrica padrão de avaliação é a precisão no conjunto de teste, em que o modelo deve selecionar a alternativa correta. Modelos iniciais baseados em sequência a sequência e redes neurais com memória de longo prazo alcançaram precisões em torno de 30 a 40%. Abordagens mais recentes, incluindo arquiteturas baseadas em transformadores e grandes modelos de linguagem, melhoraram significativamente o desempenho, atingindo precisões acima de 80% no conjunto de teste.

O conjunto também é usado para avaliar a capacidade dos modelos de gerar etapas de raciocínio interpretáveis. Como os programas lineares são fornecidos, os pesquisadores podem medir não apenas se a resposta final está correta, mas também se o programa previsto corresponde ao programa de referência. Isso levou ao desenvolvimento de modelos que combinam geração e execução de programas, melhorando tanto a precisão quanto a interpretabilidade.

Conjuntos de Dados e Tarefas Relacionados

O MathQA faz parte de uma família mais ampla de conjuntos de dados de problemas matemáticos em linguagem natural, incluindo MAWPS, ASDiv e GSM8K. Em comparação com esses, o MathQA oferece um número maior de problemas e requisitos de raciocínio mais complexos, pois muitos problemas envolvem múltiplas etapas e uma variedade maior de operações matemáticas. O conjunto é frequentemente usado em conjunto com outros recursos para treinar e avaliar modelos em tarefas de processamento de linguagem natural e aprendizado profundo.

A tarefa de resolver problemas matemáticos em linguagem natural é considerada um desafio importante para testar a compreensão e o raciocínio de máquinas. Ela exige entender o texto, extrair quantidades relevantes e aplicar operações aritméticas ou algébricas apropriadas. O esquema de anotação do MathQA, com programas operacionais explícitos, fornece uma maneira estruturada de abordar essa tarefa e influenciou o design de conjuntos de dados posteriores.

Limitações e Controvérsias

Uma limitação notável do MathQA é que alguns dos programas anotados contêm erros ou inconsistências, o que pode confundir os modelos durante o treinamento. Pesquisadores identificaram problemas como uso incorreto de operadores ou etapas ausentes. Além disso, o formato de múltipla escolha pode permitir que os modelos explorem padrões nas opções de resposta, em vez de realizar um raciocínio genuíno. Alguns estudos mostraram que modelos podem alcançar precisão acima do acaso usando pistas superficiais, como o comprimento das opções ou a presença de certos números.

Outra crítica é que os problemas são relativamente restritos em escopo, focando em aritmética e álgebra simples, e podem não capturar toda a diversidade do raciocínio matemático. Apesar dessas limitações, o MathQA continua sendo uma referência amplamente utilizada para avaliar e desenvolver sistemas de IA com habilidades de resolução de problemas matemáticos.

Ver Também

Referências

  • Amini, A., Gabriel, S., Lin, S., Koncel-Kedziorski, R., Choi, Y., & Hajishirzi, H. (2019). MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms. In Proceedings of NAACL-HLT.
  • O conjunto de dados MathQA está disponível em https://math-qa.github.io/ (acessado em 2025).
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:datasets·natural-language-processing·mathematical-reasoning·artificial-intelligence
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico