Conjunto de datos MNIST

Traducido del inglés

La base de datos MNIST es una gran colección de 70,000 imágenes de dígitos escritos a mano, ampliamente utilizada para entrenar y probar sistemas de aprendizaje automático y procesamiento de imágenes. Fue creada al re-mezclar muestras de los conjuntos de datos originales del NIST y se ha convertido en un punto de referencia fundamental en el campo.

La base de datos MNIST (base de datos del Instituto Nacional de Estándares y Tecnología modificado) es una gran base de datos de dígitos escritos a mano que se utiliza comúnmente para entrenar diversos sistemas de procesamiento de imágenes. También se usa ampliamente para entrenamiento y pruebas en el campo del aprendizaje automático. La base de datos fue creada "remezclando" las muestras de los conjuntos de datos originales del NIST, ya que los creadores consideraban que el conjunto de entrenamiento original, tomado de empleados de la Oficina del Censo de Estados Unidos, y el conjunto de pruebas, tomado de estudiantes de secundaria estadounidenses, no eran adecuados para experimentos de aprendizaje automático. Las imágenes en blanco y negro del NIST se normalizaron para ajustarse a un cuadro delimitador de 28x28 píxeles y se aplicó suavizado antialias, lo que introdujo niveles de escala de grises.

La base de datos MNIST contiene 60,000 imágenes de entrenamiento y 10,000 imágenes de prueba. La mitad del conjunto de entrenamiento y la mitad del conjunto de prueba se tomaron del conjunto de entrenamiento del NIST, mientras que la otra mitad de cada uno provino del conjunto de pruebas del NIST. Los creadores originales mantienen una lista de métodos probados en ella; en su artículo original, utilizaron una máquina de vectores de soporte para lograr una tasa de error del 0.8%. El conjunto de datos MNIST original contiene al menos cuatro etiquetas incorrectas.

Historia

Base de datos USPS

En 1988, se construyó un conjunto de datos de dígitos del Servicio Postal de Estados Unidos. Contenía imágenes en escala de grises de 16×16 digitalizadas a partir de códigos postales escritos a mano en correo estadounidense que pasaba por la oficina postal de Buffalo, Nueva York. El conjunto de entrenamiento tenía 7,291 imágenes, y el conjunto de prueba tenía 2,007, totalizando 9,298. Ambos conjuntos contenían datos ambiguos, inclasificables y mal clasificados. Este conjunto de datos se utilizó para entrenar y evaluar el LeNet de 1989. La tarea era difícil; en el conjunto de prueba, dos humanos cometieron errores a una tasa promedio del 2.5%.

Base de datos especial

A finales de la década de 1980, la Oficina del Censo estaba interesada en la digitalización automática de formularios de censo escritos a mano y reclutó al Grupo de Reconocimiento de Imágenes (IRG) del NIST para evaluar sistemas de OCR. Varios años de trabajo resultaron en varias "bases de datos especiales" y puntos de referencia. De particular importancia para MNIST son la Base de Datos Especial 1 (SD-1), publicada en mayo de 1990, la Base de Datos Especial 3 (SD-3), publicada en febrero de 1992, y la Base de Datos Especial 7 (SD-7), o Datos de Prueba del NIST 1 (TD-1), publicada en abril de 1992. Se publicaron en CD-ROM ISO-9660. Los datos se obtuvieron pidiendo a personas que escribieran en "Formularios de Muestra de Escritura" (HSF), luego digitalizando los formularios y segmentando los caracteres alfanuméricos. Cada escritor escribió un único HSF.

Cada HSF contiene múltiples campos de entrada, incluidos campos de nombre y fecha, un campo de ciudad/estado, 28 campos de dígitos, un campo de mayúsculas, un campo de minúsculas y un párrafo de texto de la Constitución sin restricciones. Cada HSF se escaneó a una resolución de 300 puntos por pulgada (11.8 puntos por milímetro).

SD-1 y SD-3 se construyeron a partir del mismo conjunto de HSF por 2,100 de los 3,400 trabajadores de campo permanentes del censo como parte del censo de Estados Unidos de 1990. SD-1 contenía los campos de entrada de datos segmentados, pero no los alfanuméricos segmentados. SD-3 contenía imágenes binarias de 128×128 digitalizadas a partir de alfanuméricos segmentados, con 223,125 dígitos, 44,951 letras mayúsculas y 45,313 letras minúsculas.

SD-7 (o TD-1) era el conjunto de prueba, que contenía 58,646 imágenes binarias de 128×128 escritas por 500 estudiantes de secundaria en Bethesda, Maryland, descritos como "estudiantes de matemáticas y ciencias en una escuela secundaria como un breve ejercicio durante clase". Cada imagen estaba acompañada por un identificador entero único para la identidad del escritor. SD-7 se publicó sin etiquetas en CD-ROM, con etiquetas publicadas posteriormente en disquetes. No contenía los HSF. La tasa de error humano en SD-7 era del 1.5%.

SD-3 era mucho más limpio y fácil de reconocer que SD-7. El siete cruzado europeo (7) era mucho más abundante en SD-7 que en SD-3. Se sospechaba que SD-3 fue producido por personas más motivadas que SD-7, y que el segmentador de caracteres para SD-3, un diseño más antiguo, fallaba con más frecuencia, filtrando instancias más difíciles. Los sistemas de aprendizaje automático entrenados y validados en SD-3 sufrieron caídas significativas en el rendimiento en SD-7, de una tasa de error de menos del 1% a aproximadamente el 10%.

En 1992, el NIST y la Oficina del Censo patrocinaron una competencia y conferencia para determinar el estado del arte. A los equipos se les dio SD-3 como conjunto de entrenamiento antes del 23 de marzo, SD-7 como conjunto de prueba antes del 13 de abril, y debían enviar sistemas para clasificar SD-7 antes del 27 de abril. Se enviaron un total de 45 algoritmos de 26 empresas en 7 países. El 27 y 28 de mayo, todas las partes se reunieron en Gaithersburg, Maryland, en la Primera Conferencia de Sistemas de OCR del Censo, con observadores del FBI, IRS y USPS. La entrada ganadora no usó SD-3 para entrenamiento sino un conjunto de entrenamiento propietario mucho más grande, evitando el cambio de distribución. Entre las 25 entradas que usaron SD-3, el ganador fue un clasificador de vecino más cercano con una métrica artesanal invariante a transformaciones euclidianas.

SD-19 se publicó en 1995 como una compilación de SD-1, SD-3, SD-7 y datos adicionales. Contenía 814,255 imágenes binarias de alfanuméricos e imágenes binarias de 4,169 HSF, incluidos los 500 HSF utilizados para generar SD-7. Se actualizó en 2016.

Construcción de MNIST

MNIST se construyó en algún momento antes del verano de 1994 mezclando imágenes binarias de 128x128 de SD-3 y SD-7. Específicamente, los creadores primero tomaron todas las imágenes de SD-7 y las dividieron en un conjunto de entrenamiento y un conjunto de prueba, cada uno de 250 escritores, resultando en casi 30,000 imágenes en cada conjunto. Luego agregaron más imágenes de SD-3 hasta que cada conjunto contuviera exactamente 60,000 imágenes.

Cada imagen se normalizó en tamaño para ajustarse a una caja de 20x20 píxeles preservando su relación de aspecto, y se aplicó suavizado antialias a escala de grises. Luego se colocó en una imagen de 28x28 traduciéndola hasta que el centro de masa de los píxeles estuviera en el centro de la imagen. Los detalles del procedimiento de reducción de muestreo se reconstruyeron posteriormente.

El conjunto de entrenamiento y el conjunto de prueba tenían originalmente 60,000 muestras cada uno, pero 50,000 de las muestras del conjunto de prueba se descartaron, dejando solo las muestras indexadas del 24,476 al 34,475, dando solo 10,000 muestras en el conjunto de prueba.

Versiones adicionales

En 2019, el conjunto de prueba completo de 60,000 de MNIST se restauró para construir QMNIST, que tiene 60,000 imágenes en el conjunto de entrenamiento y 60,000 en el conjunto de prueba.

MNIST extendido (EMNIST) es un conjunto de datos más nuevo desarrollado y publicado por el NIST como sucesor de MNIST, lanzado en 2017. Mientras que MNIST incluía solo dígitos escritos a mano, EMNIST se construyó a partir de todas las imágenes en SD-19, incluyendo letras y dígitos, y proporciona un punto de referencia más desafiante para la investigación en aprendizaje profundo y inteligencia artificial.

Legado

MNIST se ha convertido en un punto de referencia fundamental en la educación e investigación del aprendizaje automático, a menudo utilizado como una primera prueba para nuevos algoritmos y arquitecturas. Su simplicidad y pequeño tamaño lo hacen ideal para enseñar conceptos en el entrenamiento y evaluación de redes neuronales. La adopción generalizada del conjunto de datos ha influido en el desarrollo de puntos de referencia posteriores y ha contribuido al crecimiento del campo, incluidos los avances en aprendizaje profundo y IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·machine-learning·computer-vision·benchmark
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial