MATH 2025 es un conjunto de datos de referencia diseñado para evaluar las capacidades de razonamiento matemático de los modelos de lenguaje grandes (LLM, por sus siglas en inglés). Publicado en 2025, consta de 5,000 problemas de estilo competitivo que abarcan álgebra, geometría, teoría de números, combinatoria y cálculo. A diferencia de los puntos de referencia anteriores, MATH 2025 incluye un conjunto de prueba oculto que no es accesible públicamente, con el objetivo de reducir el sobreajuste y proporcionar una medida más robusta de la generalización. El punto de referencia es mantenido por un consorcio de investigadores académicos e industriales, con una tabla de clasificación actualizada trimestralmente para rastrear el progreso en el razonamiento de la IA.
El conjunto de datos se introdujo a principios de 2025 como sucesor del punto de referencia MATH original (2021), que tenía 12,500 problemas. MATH 2025 se centra en un conjunto más pequeño pero más desafiante, con problemas extraídos de competiciones recientes de estilo olimpiada y contribuciones novedosas de instituciones participantes. Cada problema está emparejado con una solución paso a paso, lo que permite un análisis detallado de errores. El conjunto de prueba oculto se controla a través de una API, evitando el acceso directo y fomentando una evaluación justa. Los modelos se puntúan según la precisión de coincidencia exacta, con crédito parcial por pasos intermedios correctos.
Composición de Problemas y Dificultad
MATH 2025 incluye 1,000 problemas por área temática: álgebra, geometría, teoría de números, combinatoria y cálculo. Los niveles de dificultad van desde la olimpiada de secundaria hasta el nivel universitario, con un promedio de problemas que requieren múltiples pasos de razonamiento. Por ejemplo, un problema de álgebra de muestra pregunta: "Encuentra la suma de todas las raíces reales de la ecuación x^5 - 5x^3 + 4x = 0." Un problema de geometría implica demostrar una propiedad de cuadriláteros cíclicos. Los problemas están diseñados para ser inequívocos, con respuestas numéricas únicas o de forma corta.
Metodología de Evaluación
Los modelos se evalúan a través de la API, que devuelve una puntuación basada en la coincidencia exacta de respuestas. La tabla de clasificación, actualizada trimestralmente (marzo, junio, septiembre, diciembre), clasifica los envíos por precisión general. Hasta el primer trimestre, el modelo de mejor rendimiento logró un 72% de precisión, mientras que los puntos de referencia de expertos humanos alcanzaron alrededor del 85%. El punto de referencia también informa desgloses por tema, revelando que la geometría sigue siendo la categoría más difícil, con una precisión promedio un 15% menor que el álgebra. Para prevenir la contaminación de datos, el conjunto de prueba se rota cada seis meses, con nuevos problemas añadidos de competiciones en curso.
Impacto en la Investigación de IA
MATH 2025 se ha convertido en una referencia estándar para evaluar el razonamiento en modelos de lenguaje grandes. Ha destacado limitaciones en los enfoques actuales, particularmente en la deducción de múltiples pasos y la manipulación simbólica. Varios modelos de OpenAI y Google DeepMind han utilizado el punto de referencia para guiar el entrenamiento, incorporando técnicas como aprendizaje curricular y RLHF para mejorar el rendimiento. El punto de referencia también ha impulsado la investigación en razonamiento en cadena de pensamiento, que aumenta significativamente la precisión en problemas complejos.
Puntos de Referencia Relacionados y Direcciones Futuras
El punto de referencia original MATH 2021 sigue siendo ampliamente utilizado, pero MATH 2025 ofrece una prueba más rigurosa. Otras evaluaciones relacionadas incluyen GSM8K para matemáticas de nivel escolar y Hendrycks Math para problemas de competición. Se planean versiones futuras de MATH 2025 para incluir problemas más abiertos y verificación automatizada de pruebas. El consorcio detrás del punto de referencia, que incluye investigadores de MIT CSAIL y Stanford AI Lab, tiene como objetivo expandir el conjunto de datos a 10,000 problemas para 2026, con un mayor enfoque en el razonamiento interdisciplinario.
Controversias y Limitaciones
Algunos investigadores han criticado el conjunto de prueba oculto por ser opaco, lo que dificulta diagnosticar errores de los modelos. Otros señalan que el punto de referencia aún puede ser susceptible a fugas de datos a través de exposición indirecta. El acceso controlado por API también plantea preocupaciones sobre la reproducibilidad, ya que no todos los investigadores pueden permitirse evaluaciones repetidas. A pesar de estos problemas, MATH 2025 es ampliamente considerado como un paso significativo en la evaluación de la IA, proporcionando una prueba desafiante y dinámica de la inteligencia matemática.