MATH 2025 é um conjunto de dados de referência projetado para avaliar as capacidades de raciocínio matemático de modelos de linguagem de grande porte (LLMs). Lançado em 2025, consiste em 5.000 problemas no estilo de competição, abrangendo álgebra, geometria, teoria dos números, combinatória e cálculo. Diferentemente de benchmarks anteriores, o MATH 2025 inclui um conjunto de teste oculto que não é publicamente acessível, visando reduzir o sobreajuste e fornecer uma medida mais robusta de generalização. O benchmark é mantido por um consórcio de pesquisadores acadêmicos e da indústria, com um leaderboard atualizado trimestralmente para acompanhar o progresso no raciocínio de IA.
O conjunto de dados foi introduzido no início de 2025 como sucessor do benchmark MATH original (2021), que tinha 12.500 problemas. O MATH 2025 foca em um conjunto menor, porém mais desafiador, com problemas extraídos de competições recentes no estilo olimpíada e contribuições inéditas de instituições participantes. Cada problema é acompanhado de uma solução passo a passo, permitindo uma análise detalhada de erros. O conjunto de teste oculto é controlado por meio de uma API, impedindo o acesso direto e incentivando uma avaliação justa. Os modelos são pontuados com base na correspondência exata de respostas, com crédito parcial para etapas intermediárias corretas.
Composição dos Problemas e Dificuldade
O MATH 2025 inclui 1.000 problemas por área temática: álgebra, geometria, teoria dos números, combinatória e cálculo. Os níveis de dificuldade variam de olimpíadas de ensino médio a graduação, com um problema médio exigindo múltiplas etapas de raciocínio. Por exemplo, um problema de álgebra amostral pergunta: "Encontre a soma de todas as raízes reais da equação x^5 - 5x^3 + 4x = 0." Um problema de geometria envolve provar uma propriedade de quadrilátero cíclico. Os problemas são projetados para serem inequívocos, com respostas numéricas ou curtas únicas.
Metodologia de Avaliação
Os modelos são avaliados por meio da API, que retorna uma pontuação baseada na correspondência exata de respostas. O leaderboard, atualizado trimestralmente (março, junho, setembro, dezembro), classifica as submissões pela precisão geral. No primeiro trimestre, o modelo de melhor desempenho alcançou 72% de precisão, enquanto os baselines de especialistas humanos pontuaram cerca de 85%. O benchmark também relata detalhamentos por tópico, revelando que a geometria permanece a categoria mais difícil, com precisão média 15% menor que a álgebra. Para prevenir contaminação de dados, o conjunto de teste é rotacionado a cada seis meses, com novos problemas adicionados de competições em andamento.
Impacto na Pesquisa em IA
O MATH 2025 tornou-se uma referência padrão para avaliar o raciocínio em modelos de linguagem de grande porte. Ele destacou limitações nas abordagens atuais, particularmente em dedução de múltiplas etapas e manipulação simbólica. Vários modelos da OpenAI e do Google DeepMind usaram o benchmark para orientar o treinamento, incorporando técnicas como aprendizado curricular e RLHF para melhorar o desempenho. O benchmark também estimulou pesquisas em prompting de cadeia de pensamento, que aumenta significativamente a precisão em problemas complexos.
Benchmarks Relacionados e Direções Futuras
O benchmark MATH 2021 original permanece amplamente utilizado, mas o MATH 2025 oferece um teste mais rigoroso. Outras avaliações relacionadas incluem GSM8K para matemática de ensino fundamental e Hendrycks Math para problemas de competição. Versões futuras do MATH 2025 estão planejadas para incluir problemas mais abertos e verificação automatizada de provas. O consórcio por trás do benchmark, que inclui pesquisadores do MIT CSAIL e do Stanford AI Lab, visa expandir o conjunto de dados para 10.000 problemas até 2026, com maior foco em raciocínio interdisciplinar.
Controvérsias e Limitações
Alguns pesquisadores criticaram o conjunto de teste oculto por ser opaco, dificultando o diagnóstico de erros dos modelos. Outros observam que o benchmark ainda pode ser suscetível a vazamento de dados por meio de exposição indireta. O acesso controlado por API também levanta preocupações sobre reprodutibilidade, pois nem todos os pesquisadores podem arcar com avaliações repetidas. Apesar dessas questões, o MATH 2025 é amplamente considerado um avanço significativo na avaliação de IA, fornecendo um teste desafiador e dinâmico da inteligência matemática.