Traduzido do inglês

GSM8K é um conjunto de dados de referência composto por 8.500 problemas de matemática de nível escolar, utilizados para avaliar as capacidades de raciocinio de grandes modelos de linguagem, introducido pela OpenAI em 2021.

GSM8K (Grade School Math 8K) é um conjunto de dados composto por 8.500 problemas matemáticos de nível escolar, de alta qualidade e linguisticamente diversos, criado por pesquisadores da OpenAI e lançado em 2021. Ele foi projetado para avaliar as capacidades de raciocínio matemático de múltiplas etapas de grandes modelos de linguagem (LLMs). Cada problema exige de duas a oito etapas para ser resolvido, envolvendo operações aritméticas básicas e dedução lógica, com foco na compreensão de linguagem natural em vez de conhecimento matemático avançado.

O benchmark tornou-se um teste padrão para avaliar as habilidades de raciocínio de sistemas de IA, particularmente no contexto da pesquisa em inteligência artificial. Seu nome deriva do tamanho do conjunto de dados (8.500 problemas) e do foco em matemática de nível escolar. Os problemas são escritos para serem resolvidos por um estudante brilhante do ensino fundamental, mas frequentemente exigem que os modelos realizem cálculos sequenciais e mantenham estado intermediário, o que representa um desafio significativo para as primeiras arquiteturas de redes neurais.

Design e Composição do Conjunto de Dados

O conjunto de dados GSM8K foi construído por uma equipe de anotadores que escreveram problemas em um estilo que imita questões matemáticas do mundo real, como aquelas encontradas em livros didáticos ou testes padronizados. Os problemas cobrem tópicos como frações, porcentagens, razões e álgebra simples, mas são deliberadamente formulados de uma maneira que evita padrões formulaicos, incentivando os modelos a se engajarem em raciocínio genuíno em vez de correspondência de padrões. O conjunto de dados é dividido em um conjunto de treinamento com 7.500 problemas e um conjunto de teste com 1.000 problemas, sendo o conjunto de teste usado para avaliação.

Cada problema no GSM8K é acompanhado por uma solução em linguagem natural que divide o raciocínio em etapas. Essas soluções não são apenas respostas finais, mas incluem cálculos intermediários e explicações, que são úteis para treinar modelos a gerar raciocínio passo a passo. O conjunto de dados também inclui um conjunto separado de 1.000 problemas com soluções mais detalhadas, conhecido como versão 'cadeia de pensamento', que foi posteriormente usado para estudar o impacto de técnicas de prompting.

Papel na Avaliação de Modelos de Linguagem

O GSM8K rapidamente se tornou um benchmark-chave para medir as capacidades de raciocínio de modelos baseados em transformers. Os primeiros modelos de aprendizado profundo tiveram dificuldades com o conjunto de dados, frequentemente alcançando precisão abaixo de 10 por cento, pois não conseguiam realizar aritmética de múltiplas etapas de forma confiável. A introdução do prompting de cadeia de pensamento, onde os modelos são incentivados a produzir etapas de raciocínio intermediárias antes da resposta final, levou a melhorias significativas, com modelos como GPT-3 e versões posteriores alcançando pontuações muito mais altas.

O benchmark tem sido usado para comparar modelos de várias organizações, incluindo Anthropic, Google DeepMind e Meta (embora não esteja na lista fornecida, é uma referência comum). Também é usado para estudar os limites do aprendizado de máquina no raciocínio matemático, com pesquisadores analisando modos de falha, como erros aritméticos, má interpretação de enunciados de problemas e incapacidade de lidar com números grandes.

Impacto na Pesquisa em IA

O GSM8K influenciou o desenvolvimento de técnicas para melhorar o raciocínio em LLMs. Ele foi fundamental para demonstrar o valor do escalonamento de redes neurais, pois modelos maiores treinados com mais dados mostraram melhorias marcantes no benchmark. O conjunto de dados também estimulou pesquisas em métodos de IA generativa para verificação, como treinar modelos separados para verificar a correção das soluções, e em abordagens de aprendizado por reforço que recompensam etapas de raciocínio corretas.

Além de seu uso como ferramenta de avaliação, o GSM8K tem sido usado como recurso de treinamento. Alguns pesquisadores usaram o conjunto de treinamento para ajustar modelos especificamente para raciocínio matemático, enquanto outros o usaram para gerar dados sintéticos para treinamento adicional. O design do conjunto de dados, com sua ênfase em linguagem natural e problemas de múltiplas etapas, também informou a criação de outros benchmarks, como MATH (um conjunto de dados mais avançado) e SVAMP (uma variante com problemas modificados).

Limitações e Críticas

Apesar de sua popularidade, o GSM8K tem limitações. Críticos notam que o conjunto de dados é relativamente pequeno e pode não capturar toda a complexidade do raciocínio matemático, pois os problemas são limitados ao nível escolar. Além disso, os modelos podem às vezes alcançar pontuações altas explorando regularidades estatísticas nos problemas em vez de raciocínio verdadeiro, um fenômeno conhecido como 'aprendizado por atalhos'. O benchmark também não testa a compreensão de conceitos matemáticos além da aritmética, como geometria ou cálculo.

Outra crítica é que os problemas do conjunto de dados estão em inglês e refletem um contexto educacional ocidental, o que pode limitar sua aplicabilidade a outros idiomas ou contextos culturais. Pesquisadores têm pedido benchmarks mais diversos e desafiadores para complementar o GSM8K, levando ao desenvolvimento de conjuntos de dados como MATH e o mais recente GSM8K-Sym, que introduz variações simbólicas para testar robustez.

Uso Atual e Direções Futuras

Em 2025, o GSM8K permanece um benchmark amplamente usado na comunidade de aprendizado de máquina, frequentemente incluído em suítes de avaliação para novos LLMs. Ele é frequentemente citado em artigos de pesquisa e usado por empresas para relatar o desempenho de modelos. No entanto, à medida que os modelos melhoraram, muitos agora alcançam precisão acima de 90 por cento no conjunto de teste, levando alguns a argumentar que o benchmark está se tornando saturado. Isso motivou a criação de versões mais difíceis, como GSM8K-Hard, que aumenta o número de etapas necessárias, e a integração do GSM8K em benchmarks de raciocínio mais amplos, como MMLU e BIG-bench.

O futuro do GSM8K provavelmente envolve seu uso como linha de base em vez de diferenciador, com pesquisadores focando em tarefas de raciocínio mais complexas. No entanto, sua contribuição para o campo é significativa, pois ajudou a catalisar o desenvolvimento de técnicas para raciocínio de múltiplas etapas em IA, que agora são centrais para muitas aplicações em inteligência artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·mathematics·natural-language-processing·evaluation
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico