La base de datos MNIST (base de datos del Instituto Nacional de Estándares y Tecnología Modificado) es una gran colección de imágenes de dígitos escritos a mano, comúnmente utilizada para entrenar y probar sistemas de procesamiento de imágenes y aprendizaje automático. Creada al re-mezclar muestras de los conjuntos de datos originales del NIST, fue diseñada para abordar las limitaciones de los datos de entrenamiento del NIST, que provenían de empleados de la Oficina del Censo de los Estados Unidos, y sus datos de prueba, de estudiantes de secundaria estadounidenses, lo que la hacía inadecuada para experimentos de aprendizaje automático. Las imágenes en blanco y negro se normalizaron a cuadros delimitadores de 28x28 píxeles y se aplicó antialiasing, introduciendo niveles de gris.
MNIST contiene 60,000 imágenes de entrenamiento y 10,000 imágenes de prueba, con la mitad de cada conjunto proveniente de los datos de entrenamiento del NIST y la otra mitad de sus datos de prueba. Los creadores mantienen una lista de métodos probados en el conjunto de datos, y su artículo original reportó una tasa de error del 0.8% utilizando una máquina de vectores de soporte. El conjunto de datos MNIST original incluye al menos cuatro etiquetas incorrectas, una peculiaridad conocida.
Predecesores y Orígenes
Antes de MNIST, la base de datos del USPS (1988) proporcionó un conjunto de dígitos más pequeño a partir de códigos postales escritos a mano en el correo de los Estados Unidos. Contenía imágenes en escala de grises de 16x16 píxeles, con 7,291 imágenes de entrenamiento y 2,007 de prueba, totalizando 9,298. Este conjunto incluía muestras ambiguas y clasificadas incorrectamente, y era desafiante, con tasas de error humano promedio del 2.5%. Se utilizó para entrenar la arquitectura temprana LeNet de 1989.
A finales de los años 80, la Oficina del Censo buscaba automatizar la digitalización de formularios escritos a mano, contratando al Grupo de Reconocimiento de Imágenes del NIST para evaluar sistemas de OCR. Su trabajo produjo varias bases de datos especiales: SD-1 (1990), SD-3 (1992) y SD-7 (1992). Estas se construyeron a partir de Formularios de Muestras de Escritura (HSFs, por sus siglas en inglés), escaneados a 300 dpi, con varios campos para nombres, dígitos y letras. SD-3 contenía imágenes binarias de 128x128 pí xiles de caracteres segmentados, incluyendo 223,125 dígitos, y se derivó de trabajadores del censo. SD-7, el conjunto de prueba, tenía 58,646 imágenes de 500 estudiantes de secundaria, con un error humano del 1.5%. Notablemente, SD-3 era más limpio y fácil, pero los sistemas de aprendizaje automático entrenados en SD-3 mostraban caídas en el rendimiento a aproximadamente -10% de error en SD-7, lo que resalta los manejos distribuidos.
Una competencia del NIST de 1992 utilizó SD-3 como datos de entrenamiento y SD-7 como el conjunto de prueba, con 45 algoritmos de 26 empresas. El ganador usó un conjunto de entrenamiento propietario, mientras que el mejor entre los sistemas entrenados con SD-3 fue un clasificador de vecino más cercano con un pat plano invariante. SD-19 (1995) combinó varias bases de datos especiales, conteniendo 814,255 imágenes.
Creación de MNIST
En algún momento antes del verano de 1994, MNIST se construyó a partir de SD-3 y SD-7. Los creadores dividieron las imágenes de SD-7 en conjuntos de entrenamiento y prueba, cada uno proveniente de 250 escribas, obteniendo aproximadamente 30,000 imágenes por conjunto. Luego las aumentaron con imágenes de SD-3 para llegar a 60,000 muestras por conjunto. Todas las imágenes se normalizaron al tamaño de la caja de 20x24 pí xeles, manteniendo la relación de aspecto, y se aplicó antialiasing a escala de grises, luego se centraron en una imagen de 28x28 ajustando el centro de masa. Los detalles del submuestreo fueron reconstruidos posteriormente.
Inicialmente, tanto el conjunto de entrenamiento como el de prueba tenían 60,000 muestras, pero para reducir el tamaño del último, se descartaron 50,000 muestras, conservando solo los índices 24476-34475, entre ellos, resultando en 10,000 imágenes 34,475, resultando en 10,000 imágenes 34,475, resultando en 10,000 imágenes de prueba.
Evaluación y Impacto
MNIST se convirtió en una línea base estándar en la investigación de Machine learning y Deep learning. Es ampliamente utilizado para comparar algoritmos, desde modelos lineales simples hasta modelos complejos Neural network. El tamaño de imagen pequeño y el número modesto de muestras lo hacen ideal para prototipos. Su disponibilidad pública y sus puntos de referencia claros lo han hecho una herramienta educativa común.
Huella y Sucesores
Extended MNIST (EMNIST) es un conjunto de datos más nuevo desarrollado por el Instituto Nacional de Estándares y Tecnología (NIST), publicado en 2017, como sucesor de MNIST. Incluye dígitos y letras escritos a mano, con categorías más amplias. En 2019, se restauró el conjunto de prueba completo de 60,000 muestras de MNIST para crear QMNIST, proporcionando un conjunto de pruebas más grande para investigación. Estas derivadas mantienen la estructura de MNIST mientras expanden su diversidad.
Véase También
Referencias
- Artículo original de MNIST por Yann LeCun et al., 1998 (proporcionado en datos de fondo).
- Publicaciones de Bases de Datos Especiales del NIST e informes de benchmarks de OCR.