Kuzushiji-MNIST es un conjunto de datos de referencia para la clasificación de imágenes en aprendizaje automático y aprendizaje profundo. Consiste en 70,000 imágenes en escala de grises de 28x28 píxeles de caracteres hiragana japoneses escritos a mano, divididas en un conjunto de entrenamiento de 60,000 muestras y un conjunto de prueba de 10,000 muestras. El conjunto de datos fue creado como una alternativa moderna al clásico conjunto de datos MNIST de dígitos escritos a mano, que se ha utilizado ampliamente desde finales de la década de 1990 para evaluar algoritmos de redes neuronales. Kuzushiji-MNIST conserva las mismas dimensiones de imagen, formato de datos y número de clases (10) que el MNIST original, lo que lo convierte en un reemplazo directo para los investigadores que deseen probar modelos en una tarea más desafiante y culturalmente significativa.
El conjunto de datos fue presentado en 2018 por un equipo de investigadores de la Universidad de Tokio y el Instituto Nacional de Literatura Japonesa, liderado por Tarin Clanuwat y sus colegas. Se publicó junto con dos conjuntos de datos relacionados: Kuzushiji-49, que contiene 49 clases de caracteres hiragana, y Kuzushiji-Kanji, que incluye 3,832 clases de kanji cursivo. La motivación principal fue abordar el problema del reconocimiento óptico de caracteres (OCR) para documentos históricos japoneses, que están escritos en una escritura cursiva conocida como kuzushiji. Esta escritura se utilizó ampliamente desde el siglo VIII hasta el siglo XIX, pero fue abandonada en gran medida después de las reformas educativas de 1900, dejando millones de textos históricos ilegibles para los hablantes japoneses modernos.
Diseño y Construcción
Las imágenes en Kuzushiji-MNIST se derivaron de un gran corpus de libros y manuscritos históricos japoneses escaneados. Los investigadores utilizaron una combinación de segmentación automática y anotación manual para extraer imágenes de caracteres individuales de estos documentos. Cada imagen se redimensionó a 28x28 píxeles y se convirtió a escala de grises, con valores de píxel que van de 0 (negro) a 255 (blanco), coincidiendo exactamente con el formato del conjunto de datos MNIST original. Las 10 clases corresponden a los diez caracteres hiragana más comunes en el corpus, que son: 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're' y 'wo'. Estos caracteres se eligieron para equilibrar la frecuencia de clase y la distinción visual, asegurando que la tarea de clasificación no sea trivial ni imposiblemente difícil.
El conjunto de datos se distribuye en un formato binario idéntico al MNIST original, con archivos separados para imágenes de entrenamiento, etiquetas de entrenamiento, imágenes de prueba y etiquetas de prueba. Esta compatibilidad permite a los investigadores utilizar código y flujos de trabajo existentes diseñados para MNIST sin modificación, simplemente intercambiando los nuevos archivos de datos. Los creadores también proporcionaron un script de carga en Python y un README detallado para facilitar la integración en marcos comunes de aprendizaje profundo como PyTorch y TensorFlow.
Rendimiento de Referencia
Desde su publicación, Kuzushiji-MNIST se ha convertido en un estándar de referencia para evaluar modelos de clasificación de imágenes, particularmente en el contexto de aumento de datos y arquitecturas de redes residuales. La tarea es notablemente más difícil que el MNIST original porque los caracteres hiragana presentan una mayor variación intraclase y similitud visual entre diferentes clases. Por ejemplo, los caracteres para 'su' y 'tsu' a menudo se confunden incluso por lectores humanos que no están familiarizados con el kuzushiji. Como resultado, los modelos simples que logran una precisión casi perfecta en MNIST típicamente funcionan significativamente peor en Kuzushiji-MNIST, lo que lo convierte en una prueba más sensible de la capacidad y generalización del modelo.
Los resultados de última generación en Kuzushiji-MNIST se han logrado utilizando redes neuronales convolucionales (CNN) con normalización por lotes y regularización dropout. A partir de 2024, la mejor precisión de prueba reportada es de alrededor del 99.5%, lograda por un conjunto de redes residuales con un extenso aumento de datos. Sin embargo, el conjunto de datos sigue siendo desafiante para modelos ligeros y para enfoques que dependen de características diseñadas manualmente, que a menudo se estabilizan en precisiones por debajo del 95%. El punto de referencia también se ha utilizado para estudiar los efectos de las estrategias de programación de la tasa de aprendizaje y inicialización de pesos, así como la robustez de los modelos al ruido en las etiquetas.
Aplicaciones e Impacto
La aplicación principal de Kuzushiji-MNIST es como herramienta de investigación para avanzar en la tecnología OCR para documentos históricos japoneses. El proyecto Kuzushiji más amplio, del cual se deriva el conjunto de datos, tiene como objetivo digitalizar y hacer buscables los millones de libros y manuscritos escritos en kuzushiji que actualmente son inaccesibles para el público en general. Al proporcionar un punto de referencia estandarizado, el conjunto de datos ha permitido a investigadores de todo el mundo desarrollar y comparar algoritmos para reconocer caracteres cursivos, lo cual es un paso crítico hacia la transcripción automatizada de estos textos.
Más allá de su aplicación directa, Kuzushiji-MNIST ha sido adoptado como un banco de pruebas de propósito general en la educación e investigación de aprendizaje automático. Su similitud con MNIST lo convierte en una introducción accesible a la clasificación de imágenes, mientras que su mayor dificultad fomenta la exploración de técnicas más avanzadas. El conjunto de datos ha sido citado en cientos de artículos académicos y está incluido en bibliotecas populares de aprendizaje automático y materiales de cursos. También se ha utilizado para evaluar la transferibilidad de modelos entrenados en otros conjuntos de datos de caracteres, como el alfabeto latino o los caracteres chinos, proporcionando información sobre la generalización entre escrituras.
Conjuntos de Datos Relacionados y Extensiones
Los creadores de Kuzushiji-MNIST también publicaron Kuzushiji-49, que incluye los 49 caracteres hiragana, y Kuzushiji-Kanji, que cubre 3,832 caracteres kanji. Estos conjuntos de datos son más grandes y complejos, con Kuzushiji-Kanji conteniendo más de 140,000 imágenes. Están destinados a tareas OCR más avanzadas y para entrenar modelos que puedan manejar la gama completa de caracteres encontrados en documentos históricos. Además, el proyecto Kuzushiji ha publicado un gran corpus anotado de textos históricos, conocido como el Conjunto de Datos Kuzushiji, que incluye imágenes de página completa con cajas delimitadoras a nivel de carácter. Este recurso se ha utilizado en competiciones y esfuerzos de investigación colaborativa para desarrollar sistemas de transcripción de extremo a extremo.
En la comunidad de aprendizaje automático, Kuzushiji-MNIST ha inspirado esfuerzos similares para crear puntos de referencia culturalmente diversos, como el conjunto de datos EMNIST para letras escritas a mano y el conjunto de datos Fashion-MNIST para imágenes de ropa. Estos conjuntos de datos comparten el mismo formato y tamaño que el MNIST original, lo que permite una comparación directa del rendimiento del modelo en diferentes dominios. El éxito de Kuzushiji-MNIST ha destacado el valor de preservar y digitalizar escrituras históricas, y continúa sirviendo como un puente entre la preservación del patrimonio cultural y la investigación moderna en inteligencia artificial.