Traducido del inglés

Math23K es un conjunto de datos chino de 23,162 problemas matemáticos en lenguaje natural, utilizado para entrenar y evaluar modelos de IA en la resolución automática de problemas y la generación de ecuaciones.

Math23K es un conjunto de datos de referencia ampliamente utilizado en el campo del aprendizaje automático y la inteligencia artificial, diseñado específicamente para la tarea de resolver problemas matemáticos expresados en lenguaje natural. El conjunto de datos consta de 23,162 problemas matemáticos de escuela primaria en chino, cada uno acompañado de su ecuación o respuesta correspondiente. Fue introducido para abordar la escasez de conjuntos de datos a gran escala no ingleses para el razonamiento matemático, que anteriormente estaba dominado por recursos en inglés. Los investigadores utilizan Math23K para desarrollar y probar modelos que puedan analizar el lenguaje natural, extraer relaciones numéricas y generar expresiones matemáticas correctas.

El conjunto de datos fue creado por un equipo de la Academia China de Ciencias y se presentó por primera vez en un artículo de 2017 titulado "A Goal-Driven Tree-Structured Neural Model for Math Word Problems". Los problemas cubren una variedad de operaciones aritméticas, incluyendo suma, resta, multiplicación y división, a menudo involucrando escenarios del mundo real como compras, viajes y cálculos de edad. Cada problema está anotado con una plantilla de ecuación objetivo, lo que permite entrenar los modelos de manera supervisada. Math23K se ha convertido en un conjunto de evaluación estándar para solucionadores de problemas matemáticos en chino, complementando puntos de referencia en inglés como los conjuntos de datos MAWPS y ASDiv.

Estructura y anotación del conjunto de datos

Math23K contiene 23,162 problemas, divididos en conjuntos de entrenamiento, validación y prueba. La división estándar, utilizada en la mayoría de las investigaciones publicadas, asigna 21,162 problemas para entrenamiento, 1,000 para validación y 1,000 para prueba. Cada problema es una oración o párrafo corto en chino, típicamente de 20 a 50 caracteres de longitud, seguido de una ecuación de referencia. Por ejemplo, un problema podría decir: "小明有5个苹果,小红给了他3个,他一共有多少个?" (Xiao Ming tiene 5 manzanas, Xiao Hong le da 3, ¿cuántas tiene en total?), con la ecuación "5+3=8".

Las anotaciones se normalizan a una forma canónica, donde los números se reemplazan con marcadores de posición (por ejemplo, "n1", "n2") para crear plantillas de ecuación. Este diseño permite que los modelos aprendan patrones estructurales independientes de valores numéricos específicos, mejorando la generalización. El conjunto de datos también incluye respuestas de opción múltiple en algunas versiones, pero el formato principal es la generación de ecuaciones de respuesta abierta.

Arquitecturas de modelos y enfoques

Desde su publicación, Math23K se ha utilizado para evaluar una variedad de arquitecturas de redes neuronales. Los enfoques iniciales se basaban en modelos secuencia a secuencia con estructuras codificador-decodificador, que trataban el problema como una tarea de traducción de texto a ecuaciones. Estos se mejoraron posteriormente con mecanismos de atención y atención de múltiples cabezas para alinear mejor las palabras con los números. Un avance notable llegó con los modelos de estructura arbórea que representan explícitamente la naturaleza jerárquica de las expresiones aritméticas, como el modelo neuronal de estructura arbórea dirigido por objetivos del artículo original.

Trabajos más recientes han aplicado modelos basados en transformers, incluidos grandes modelos de lenguaje ajustados en Math23K. Estos modelos aprovechan representaciones preentrenadas de corpus chinos y logran una precisión de vanguardia, a menudo superando el 80% en el conjunto de prueba. Sin embargo, el conjunto de datos sigue siendo desafiante debido a sus diversos tipos de problemas y la necesidad de razonamiento de múltiples pasos. Los investigadores también han explorado técnicas de aprendizaje curricular y aumento de datos para mejorar la robustez.

Métricas de evaluación y desafíos

La métrica principal para Math23K es la precisión de la ecuación, que mide el porcentaje de problemas donde la ecuación generada coincide exactamente con la ecuación de referencia. Algunos estudios también informan la precisión de la respuesta, que considera el resultado numérico final. La dificultad del conjunto de datos proviene de varios factores: lenguaje ambiguo, operaciones implícitas y la necesidad de inferir cantidades a partir del contexto. Por ejemplo, los problemas pueden usar palabras como "多" (más) o "少" (menos) para indicar suma o resta, pero la operación exacta depende de la estructura de la oración.

Otro desafío es la presencia de información irrelevante o redundante, que puede engañar a los modelos. Además, Math23K incluye problemas con múltiples ecuaciones válidas, pero la referencia solo proporciona una, lo que hace que la evaluación de coincidencia exacta sea estricta. Como resultado, los modelos que producen respuestas correctas pero formas de ecuación diferentes son penalizados, lo que impulsa a los investigadores a desarrollar métodos de evaluación más flexibles.

Impacto y aplicaciones

Math23K ha influido significativamente en la investigación del razonamiento matemático dentro del aprendizaje profundo. Se ha utilizado para estudiar las capacidades de generalización de los modelos en diferentes tipos de problemas y para comparar la efectividad de diversas estrategias de entrenamiento. El conjunto de datos también se ha integrado en puntos de referencia más grandes, como el Corpus de Problemas Matemáticos en Chino, y ha inspirado conjuntos de datos similares en otros idiomas, incluidos inglés y japonés.

En aplicaciones prácticas, los modelos entrenados en Math23K se utilizan en tecnología educativa, como sistemas de tutoría inteligente y calificación automatizada de tareas. Empresas como Alibaba Cloud e instituciones de investigación han explorado el despliegue de estos modelos en aulas del mundo real. Sin embargo, el enfoque del conjunto de datos en aritmética de nivel elemental limita su aplicabilidad a matemáticas avanzadas, y se están realizando esfuerzos para crear conjuntos de datos más complejos.

Limitaciones y direcciones futuras

A pesar de su popularidad, Math23K tiene limitaciones conocidas. Los problemas son relativamente simples, involucrando como máximo dos o tres operaciones, y carecen de la complejidad del razonamiento matemático del mundo real. El idioma chino también introduce desafíos lingüísticos específicos, como el uso de clasificadores y un orden de palabras flexible, que pueden no transferirse a otros idiomas. Además, el conjunto de datos no incluye información visual o multimodal, lo que restringe su uso en tareas que combinan texto y diagramas.

La investigación futura tiene como objetivo expandir Math23K con tipos de problemas más diversos, anotaciones más ricas y cadenas de razonamiento de múltiples pasos. Algunos esfuerzos lo están integrando con grandes modelos de lenguaje para explorar el aprendizaje con pocos ejemplos y sin ejemplos, donde los modelos se guían con algunos ejemplos en lugar de ajustarse. A partir de 2025, Math23K sigue siendo un punto de referencia estándar, pero conjuntos de datos más nuevos como Math23K-v2 y Chinese MathQA están surgiendo para abordar sus deficiencias.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·math-word-problems·chinese-nlp·benchmark
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial