La base de datos MNIST (base de datos del Instituto Nacional de Estándares y Tecnología Modificado) es una gran base de datos de dígitos escritos a mano que se utiliza comúnmente para entrenar diversos sistemas de procesamiento de imágenes. La base de datos también se utiliza ampliamente para el entrenamiento y las pruebas en el campo del aprendizaje automático. Fue creada "remezclando" las muestras de los conjuntos de datos originales del NIST. Los creadores consideraron que, dado que el conjunto de datos de entrenamiento del NIST provenía de empleados de la Oficina del Censo de los Estados Unidos, mientras que el conjunto de datos de prueba provenía de estudiantes de secundaria estadounidenses, no era adecuado para experimentos de aprendizaje automático. Además, las imágenes en blanco y negro del NIST se normalizaron para ajustarse a un cuadro delimitador de 28x28 píxeles y se aplicó un suavizado de bordes, lo que introdujo niveles de gris.
La base de datos MNIST contiene 60.000 imágenes de entrenamiento y 10.000 imágenes de prueba. La mitad del conjunto de entrenamiento y la mitad del conjunto de prueba se tomaron del conjunto de datos de entrenamiento del NIST, mientras que la otra mitad del conjunto de entrenamiento y la otra mitad del conjunto de prueba se tomaron del conjunto de datos de prueba del NIST. Los creadores originales de la base de datos mantienen una lista de algunos de los métodos probados en ella. En su artículo original, utilizan una máquina de vectores de soporte para obtener una tasa de error del 0,8%. El conjunto de datos MNIST original contiene al menos 4 etiquetas incorrectas.
Historia
El desarrollo de MNIST fue precedido por varios conjuntos de datos y puntos de referencia relacionados. En 1988, se construyó un conjunto de datos de dígitos del Servicio Postal de los Estados Unidos, que contenía imágenes en escala de grises de 16x16 digitalizadas a partir de códigos postales escritos a mano en el correo de los EE. UU. que pasaba por la oficina de correos de Buffalo, Nueva York. El conjunto de entrenamiento tenía 7.291 imágenes y el conjunto de prueba tenía 2.007, lo que hace un total de 9.298. Tanto los conjuntos de entrenamiento como los de prueba contenían datos ambiguos, inclasificables y mal clasificados. El conjunto de datos se utilizó para entrenar y evaluar el LeNet de 1989, una red neuronal pionera. En el conjunto de prueba, dos humanos cometieron errores a una tasa promedio del 2,5%.
Base de datos especial
A finales de la década de 1980, la Oficina del Censo estaba interesada en la digitalización automática de formularios de censo escritos a mano, por lo que reclutó al Grupo de Reconocimiento de Imágenes (IRG) en el NIST para evaluar los sistemas de OCR. Varios años de trabajo dieron como resultado varias "Bases de datos especiales" y puntos de referencia. De particular importancia para MNIST son la Base de Datos Especial 1 (SD-1), publicada en mayo de 1990, la Base de Datos Especial 3 (SD-3), publicada en febrero de 1992, y la Base de Datos Especial 7 (SD-7), o Datos de Prueba 1 del NIST (TD-1), publicada en abril de 1992. Se publicaron en CD-ROM ISO-9660. Se obtuvieron pidiendo a personas que escribieran en "Formularios de Muestra de Escritura a Mano" (HSF), luego digitalizando los HSF y, a continuación, segmentando los caracteres alfanuméricos. Cada escritor escribió un solo HSF.
Cada HSF contiene múltiples campos de entrada, en los que se pedía a las personas que escribieran. Hay 34 campos: entradas de nombre y fecha, un campo de ciudad/estado, 28 campos de dígitos, un campo de mayúsculas, un campo de minúsculas y un párrafo de texto de la Constitución sin restricciones. Cada HSF se escaneó a una resolución de 300 puntos por pulgada (11,8 puntos por milímetro). SD-1 y SD-3 se construyeron a partir del mismo conjunto de HSF por 2.100 de los 3.400 trabajadores de campo permanentes del censo como parte del censo de los Estados Unidos de 1990. SD-1 contenía los campos de entrada de datos segmentados, pero no los caracteres alfanuméricos segmentados. SD-3 contenía imágenes binarias de 128x128 digitalizadas a partir de caracteres alfanuméricos segmentados, con 223.125 dígitos, 44.951 letras mayúsculas y 45.313 letras minúsculas.
SD-7 o TD-1 era el conjunto de prueba, y contenía 58.646 imágenes binarias de 128x128 escritas por 500 estudiantes de secundaria en Bethesda, Maryland. Se describieron como "estudiantes de matemáticas y ciencias en una escuela secundaria como un ejercicio corto durante la clase". Cada imagen está acompañada por una identificación entera única para la identidad de su escritor. SD-7 se publicó sin etiquetas en CD-ROM, y las etiquetas se publicaron más tarde en disquetes. No contenía los HSF. SD-7 era lo suficientemente difícil como para que la tasa de error humano fuera del 1,5%. SD-3 era mucho más limpio y fácil de reconocer que las imágenes en SD-7. El siete (7) cruzado europeo es mucho más abundante en SD-7 que en SD-3. Se sospechaba que SD-3 fue producido por personas más motivadas que las que produjeron SD-7. Además, el segmentador de caracteres para SD-3 era un diseño más antiguo que el de SD-7 y fallaba con más frecuencia. Se sospechaba que los casos más difíciles se filtraron de la construcción de SD-3, ya que los casos difíciles ni siquiera pasaban por el segmentador. Se descubrió que los sistemas de aprendizaje automático entrenados y validados en SD-3 sufrieron caídas significativas en el rendimiento en SD-7, de una tasa de error de menos del 1% a aproximadamente el 10%.
En 1992, el NIST y la Oficina del Censo patrocinaron una competencia y una conferencia para determinar el estado del arte en esta industria. En la competencia, a los equipos se les dio SD-3 como conjunto de entrenamiento antes del 23 de marzo, SD-7 como conjunto de prueba antes del 13 de abril, y debían enviar uno o más sistemas para clasificar SD-7 antes del 27 de abril. Se enviaron un total de 45 algoritmos de 26 empresas de 7 países diferentes. El 27 y 28 de mayo, todas las partes que enviaron resultados se reunieron en Gaithersburg, Maryland, en la Primera Conferencia de Sistemas de OCR del Censo. Asistieron observadores del FBI, el IRS y el USPS. La entrada ganadora no utilizó SD-3 para el entrenamiento, sino un conjunto de entrenamiento propietario mucho más grande, por lo que no se vio afectada por el cambio de distribución. Entre las 25 entradas que sí usaron SD-3 para el entrenamiento, la entrada ganadora fue un clasificador de vecino más cercano que utiliza una métrica hecha a mano que es invariante a las transformaciones euclidianas.
SD-19 se publicó en 1995, como una compilación de SD-1, SD-3, SD-7 y algunos datos adicionales. Contenía 814.255 imágenes binarias de caracteres alfanuméricos e imágenes binarias de 4.169 HSF, incluidos los 500 HSF que se utilizaron para generar SD-7. Se actualizó en 2016.
MNIST
El MNIST se construyó en algún momento antes del verano de 1994. Se construyó mezclando imágenes binarias de 128x128 de SD-3 y SD-7. Específicamente, primero tomaron todas las imágenes de SD-7 y las dividieron en un conjunto de entrenamiento y un conjunto de prueba, cada uno de 250 escritores. Esto resultó en casi 30.000 imágenes en cada conjunto. Luego agregaron más imágenes de SD-3 hasta que cada conjunto contuviera exactamente 60.000 imágenes.
Cada imagen se normalizó en tamaño para caber en una caja de 20x20 píxeles preservando su relación de aspecto, y se aplicó un suavizado de bordes para convertirla a escala de grises. Luego se colocó en una imagen de 28x28 traduciéndola hasta que el centro de masa de los píxeles esté en el centro de la imagen. Los detalles de cómo se procedió con el submuestreo se reconstruyeron. El conjunto de entrenamiento y el conjunto de prueba originalmente tenían 60k muestras cada uno, pero se descartaron 50k de las muestras del conjunto de prueba, y solo se utilizaron las muestras indexadas de 24476 a 34475, dando solo 10k muestras en el conjunto de prueba.
Versiones posteriores
En 2019, el conjunto de prueba completo de 60k de MNIST se restauró para construir el QMNIST, que tiene 60k imágenes en el conjunto de entrenamiento y 60k en el conjunto de prueba. MNIST Extendido (EMNIST) es un conjunto de datos más nuevo desarrollado y publicado por el NIST para ser el sucesor (final) de MNIST, publicado en 2017. MNIST incluía solo imágenes de dígitos escritos a mano. EMNIST se construyó a partir de todas las imágenes en SD-19, incluyendo letras además de dígitos, y proporciona un punto de referencia más desafiante para la investigación en aprendizaje profundo y inteligencia artificial.