Math23K é um conjunto de dados de referência amplamente utilizado no campo de aprendizado de máquina e inteligência artificial, especificamente projetado para a tarefa de resolver problemas matemáticos em formato de texto. O conjunto de dados consiste em 23.162 problemas de matemática do ensino fundamental em chinês, cada um acompanhado de sua equação ou resposta correspondente. Ele foi introduzido para abordar a escassez de conjuntos de dados em larga escala e não ingleses para raciocínio matemático, que anteriormente era dominada por recursos em inglês. Pesquisadores usam o Math23K para desenvolver e testar modelos que podem analisar linguagem natural, extrair relações numéricas e gerar expressões matemáticas corretas.
O conjunto de dados foi criado por uma equipe da Academia Chinesa de Ciências e foi apresentado pela primeira vez em um artigo de 2017 intitulado "A Goal-Driven Tree-Structured Neural Model for Math Word Problems". Os problemas abrangem uma variedade de operações aritméticas, incluindo adição, subtração, multiplicação e divisão, frequentemente envolvendo cenários do mundo real, como compras, viagens e cálculos de idade. Cada problema é anotado com um modelo de equação alvo, permitindo que os modelos sejam treinados de forma supervisionada. O Math23K tornou-se um conjunto de avaliação padrão para solucionadores de problemas matemáticos em chinês, complementando referências em inglês como os conjuntos de dados MAWPS e ASDiv.
Estrutura e Anotação do Conjunto de Dados
O Math23K contém 23.162 problemas, divididos em conjuntos de treinamento, validação e teste. A divisão padrão, usada na maioria das pesquisas publicadas, aloca 21.162 problemas para treinamento, 1.000 para validação e 1.000 para teste. Cada problema é uma frase ou parágrafo curto em chinês, tipicamente com 20 a 50 caracteres de comprimento, seguido por uma equação padrão-ouro. Por exemplo, um problema pode afirmar: "小明有5个苹果,小红给了他3个,他一共有多少个?" (Xiao Ming tem 5 maçãs, Xiao Hong lhe dá 3, quantas ele tem no total?), com a equação "5+3=8".
As anotações são normalizadas para uma forma canônica, onde os números são substituídos por espaços reservados (por exemplo, "n1", "n2") para criar modelos de equação. Esse design permite que os modelos aprendam padrões estruturais independentes de valores numéricos específicos, melhorando a generalização. O conjunto de dados também inclui respostas de múltipla escolha em algumas versões, mas o formato principal é a geração de equações de resposta aberta.
Arquiteturas de Modelo e Abordagens
Desde seu lançamento, o Math23K tem sido usado para avaliar uma variedade de arquiteturas de redes neurais. Abordagens iniciais dependiam de modelos sequência a sequência com estruturas codificador-decodificador, que tratavam o problema como uma tarefa de tradução de texto para equações. Essas foram posteriormente aprimoradas com mecanismos de atenção e atenção de múltiplas cabeças para melhor alinhar palavras com números. Um avanço notável veio com modelos estruturados em árvore que representam explicitamente a natureza hierárquica das expressões aritméticas, como o modelo neural estruturado em árvore orientado a objetivos do artigo original.
Trabalhos mais recentes aplicaram modelos baseados em transformadores, incluindo grandes modelos de linguagem ajustados no Math23K. Esses modelos aproveitam representações pré-treinadas de corpora chineses e alcançam precisão de ponta, frequentemente excedendo 80% no conjunto de teste. No entanto, o conjunto de dados permanece desafiador devido à diversidade de tipos de problemas e à necessidade de raciocínio em múltiplas etapas. Pesquisadores também exploraram técnicas de aprendizado curricular e aumento de dados para melhorar a robustez.
Métricas de Avaliação e Desafios
A principal métrica para o Math23K é a precisão da equação, que mede a porcentagem de problemas onde a equação gerada corresponde exatamente à equação padrão-ouro. Alguns estudos também relatam precisão da resposta, que considera o resultado numérico final. A dificuldade do conjunto de dados decorre de vários fatores: linguagem ambígua, operações implícitas e a necessidade de inferir quantidades a partir do contexto. Por exemplo, problemas podem usar palavras como "多" (mais) ou "少" (menos) para indicar adição ou subtração, mas a operação exata depende da estrutura da frase.
Outro desafio é a presença de informações irrelevantes ou redundantes, que podem enganar os modelos. Além disso, o Math23K inclui problemas com múltiplas equações válidas, mas o padrão-ouro fornece apenas uma, tornando a avaliação de correspondência exata estrita. Como resultado, modelos que produzem respostas corretas, mas com formas de equação diferentes, são penalizados, levando pesquisadores a desenvolver métodos de avaliação mais flexíveis.
Impacto e Aplicações
O Math23K influenciou significativamente a pesquisa em raciocínio matemático dentro do aprendizado profundo. Ele tem sido usado para estudar as capacidades de generalização de modelos em diferentes tipos de problemas e para comparar a eficácia de várias estratégias de treinamento. O conjunto de dados também foi integrado a referências maiores, como o Corpus Chinês de Problemas Matemáticos em Texto, e inspirou conjuntos de dados semelhantes em outros idiomas, incluindo inglês e japonês.
Em aplicações práticas, modelos treinados no Math23K são usados em tecnologia educacional, como sistemas de tutoria inteligente e correção automatizada de tarefas. Empresas como Alibaba Cloud e instituições de pesquisa exploraram a implantação desses modelos em salas de aula do mundo real. No entanto, o foco do conjunto de dados em aritmética de nível fundamental limita sua aplicabilidade a matemática avançada, e esforços estão em andamento para criar conjuntos de dados mais complexos.
Limitações e Direções Futuras
Apesar de sua popularidade, o Math23K tem limitações conhecidas. Os problemas são relativamente simples, envolvendo no máximo duas ou três operações, e carecem da complexidade do raciocínio matemático do mundo real. A língua chinesa também introduz desafios linguísticos específicos, como o uso de palavras de medida e ordem de palavras flexível, que podem não ser transferíveis para outros idiomas. Além disso, o conjunto de dados não inclui informações visuais ou multimodais, restringindo seu uso em tarefas que combinam texto e diagramas.
Pesquisas futuras visam expandir o Math23K com tipos de problemas mais diversos, anotações mais ricas e cadeias de raciocínio em múltiplas etapas. Alguns esforços estão integrando-o com grandes modelos de linguagem para explorar aprendizado com poucos exemplos e zero-shot, onde os modelos são instruídos com alguns exemplos em vez de serem ajustados. Em 2025, o Math23K permanece uma referência padrão, mas conjuntos de dados mais novos, como Math23K-v2 e Chinese MathQA, estão surgindo para abordar suas deficiências.