Kuzushiji-MNIST (KMNIST) es un conjunto de datos de 70,000 imágenes en escala de grises de caracteres Hiragana japoneses escritos a mano, cada una de 28x28 píxeles. Fue creado como una alternativa más desafiante al clásico conjunto de datos MNIST, que contiene dígitos escritos a mano. KMNIST está diseñado para ser un reemplazo directo de MNIST en los puntos de referencia de aprendizaje automático, permitiendo a los investigadores probar modelos en una tarea con estructura similar pero mayor complejidad visual debido a la naturaleza cursiva del Hiragana.
El conjunto de datos fue presentado en 2018 por un equipo de investigadores de la Universidad de Tokio, incluyendo a Tarin Clanuwat, Mikel Bober-Irizar, Asanobu Kitamoto y Alex Lamb. Se derivó del conjunto de datos Kuzushiji, que contiene más de 140,000 imágenes de literatura japonesa clásica. El subconjunto KMNIST se centra en 10 caracteres Hiragana, cada uno representado por 7,000 imágenes (6,000 para entrenamiento y 1,000 para prueba), reflejando la división exacta de MNIST.
Estructura del Conjunto de Datos
KMNIST sigue el mismo formato que MNIST: cada imagen es un arreglo en escala de grises de 28x28 píxeles, con valores de píxel que van de 0 a 255. El conjunto de datos se divide en 60,000 imágenes de entrenamiento y 10,000 imágenes de prueba. Los 10 caracteres incluidos son: 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're' y 'wo'. Estos caracteres fueron seleccionados porque se encuentran entre los más comunes en el conjunto de datos original Kuzushiji y presentan un desafío de clasificación equilibrado.
Los creadores evitaron intencionalmente usar los mismos caracteres que los dígitos de MNIST, asegurando que los modelos entrenados en KMNIST no puedan simplemente transferir características aprendidas del reconocimiento de dígitos. Los caracteres Hiragana tienen patrones de trazos y curvaturas más complejos, lo que hace que la tarea sea más difícil para los modelos tradicionales de aprendizaje automático.
Evaluación Comparativa y Rendimiento
KMNIST se ha convertido en un punto de referencia estándar en la comunidad de Machine learning, particularmente para evaluar arquitecturas de Neural network. En el MNIST original, muchos modelos logran más del 99% de precisión, pero KMNIST es significativamente más difícil. Por ejemplo, una Residual Network (ResNet) simple podría lograr alrededor del 99% en MNIST pero solo alrededor del 95% en KMNIST. Esto hace que KMNIST sea útil para distinguir entre modelos que funcionan bien en tareas simples y aquellos que generalizan a patrones más complejos.
Los investigadores han utilizado KMNIST para probar diversas técnicas, incluyendo Data Augmentation, Dropout y Batch Normalization. El conjunto de datos también está incluido en bibliotecas populares de aprendizaje automático como PyTorch y TensorFlow, lo que facilita su integración en pipelines existentes.
Conjuntos de Datos Relacionados
KMNIST es parte de una familia de conjuntos de datos similares a MNIST, incluyendo Fashion-MNIST (artículos de ropa) y EMNIST (letras y dígitos). Estos conjuntos de datos comparten el mismo formato de imagen y división, lo que permite la comparación directa del rendimiento del modelo en diferentes dominios. KMNIST es único en que se centra en una escritura no latina, proporcionando un desafío cultural y lingüístico que otros conjuntos de datos no ofrecen.
El conjunto de datos original Kuzushiji, del cual se deriva KMNIST, incluye más de 4,000 caracteres diferentes y se utiliza para el análisis de documentos históricos. KMNIST simplifica esto a un problema de 10 clases, haciéndolo accesible para fines educativos y experimentación rápida.
Aplicaciones e Impacto
KMNIST ha sido ampliamente adoptado en la investigación y educación de Deep learning. Se utiliza a menudo en cursos introductorios para enseñar el diseño de Convolutional neural network, ya que requiere arquitecturas más sofisticadas que MNIST. El conjunto de datos también se ha utilizado en estudios sobre Transfer learning y adaptación de dominio, donde modelos preentrenados en MNIST se ajustan finamente en KMNIST.
Más allá de la evaluación comparativa, KMNIST ha contribuido a la preservación y estudio del patrimonio cultural japonés. Al hacer accesibles los caracteres Hiragana clásicos en un formato legible por máquina, permite el análisis automatizado de documentos históricos, lo cual es valioso para historiadores y lingüistas.
Limitaciones y Direcciones Futuras
A pesar de su utilidad, KMNIST tiene limitaciones. Los 10 caracteres representan solo una pequeña fracción del silabario Hiragana completo, y las imágenes están preprocesadas para coincidir con el formato de MNIST, lo que puede perder parte de la información original de los trazos. Además, el conjunto de datos es relativamente pequeño en comparación con los conjuntos de datos modernos a gran escala, lo que puede limitar su uso para entrenar modelos muy profundos.
El trabajo futuro puede implicar expandir KMNIST para incluir más caracteres o crear variantes con diferentes preprocesamientos. A partir de 2025, KMNIST sigue siendo un punto de referencia estándar, pero los investigadores recurren cada vez más a conjuntos de datos más complejos como CIFAR-10 o ImageNet para evaluar modelos de última generación. Sin embargo, KMNIST continúa sirviendo como una herramienta valiosa para la creación rápida de prototipos y fines educativos.