Traducido del inglés

EMNIST (MNIST extendido) es un conjunto de datos de dígitos y letras escritos a mano, que contiene 240,000 imágenes de entrenamiento, utilizado para la investigación en aprendizaje automático y visión por computadora.

EMNIST (MNIST extendido) es un conjunto de datos de caracteres escritos a mano que amplía el conjunto de datos original MNIST de dígitos para incluir tanto dígitos como letras mayúsculas y minúsculas. Contiene 240,000 imágenes de entrenamiento y 40,000 imágenes de prueba, cada una de ellas una imagen en escala de grises de 28x28. EMNIST se utiliza ampliamente en la investigación de aprendizaje automático y aprendizaje profundo para tareas como el reconocimiento de caracteres y la evaluación comparativa de algoritmos de clasificación.

El conjunto de datos fue introducido en 2017 por Gregory Cohen, Saeed Afshar, Jonathan Tapson y André van Schaik en el Instituto MARCS para el Cerebro, el Comportamiento y el Desarrollo, de la Universidad de Western Sydney. Fue creado convirtiendo la Base de Datos Especial 19 del NIST, que contiene muestras escritas a mano de más de 3,600 escritores, al mismo formato que MNIST. EMNIST proporciona un punto de referencia más desafiante que MNIST porque incluye letras, que tienen más clases y una mayor similitud visual entre ciertos caracteres (por ejemplo, 'O' y '0', 'I' y 'l').

Variantes y divisiones

EMNIST está disponible en varias variantes, cada una con una estructura de clases diferente. La más común es EMNIST Letters, que contiene 26 clases (A-Z) y 145,600 imágenes de entrenamiento. Otras variantes incluyen EMNIST Digits (10 clases, 280,000 imágenes de entrenamiento), EMNIST Balanced (47 clases, 112,800 imágenes de entrenamiento), EMNIST ByClass (62 clases, 697,932 imágenes de entrenamiento) y EMNIST ByMerge (47 clases, 697,932 imágenes de entrenamiento). Las variantes Balanced y ByMerge fusionan ciertas mayúsculas y minúsculas (por ejemplo, 'C' y 'c') para reducir la ambigüedad, mientras que ByClass mantiene todas las clases separadas.

Uso en investigación

EMNIST se ha convertido en un punto de referencia estándar para evaluar arquitecturas de redes neuronales y técnicas de entrenamiento. A menudo se utiliza para probar mejoras en aumento de datos, abandono, normalización por lotes y otros métodos de regularización. Los investigadores también utilizan EMNIST para estudiar el aprendizaje por transferencia, donde modelos preentrenados en conjuntos de datos más grandes se ajustan finamente en EMNIST. El conjunto de datos está incluido en bibliotecas populares de aprendizaje automático como PyTorch y TensorFlow, lo que facilita su acceso para experimentación.

Relación con MNIST

EMNIST está diseñado como un reemplazo directo de MNIST, con el mismo tamaño y formato de imagen. Sin embargo, la inclusión de letras aumenta la dificultad: el número de clases aumenta de 10 a hasta 62, y la similitud entre clases es mayor. Esto hace que EMNIST sea un punto de referencia más realista para el reconocimiento de escritura a mano en aplicaciones del mundo real, como la clasificación de correo postal y el procesamiento de formularios. Muchos estudios informan que los modelos que logran una precisión casi perfecta en MNIST experimentan una caída significativa en EMNIST, lo que destaca la necesidad de métodos más robustos.

Limitaciones y extensiones

A pesar de su alcance más amplio, EMNIST aún tiene limitaciones. Se deriva de una sola fuente (NIST), por lo que puede no capturar la diversidad completa de estilos de escritura en diferentes poblaciones. Las imágenes también están preprocesadas para estar centradas y normalizadas, lo que reduce la variabilidad. Para abordar estos problemas, los investigadores han creado extensiones como Fashion-MNIST (imágenes de ropa) y Kuzushiji-MNIST (caracteres japoneses), pero EMNIST sigue siendo un punto de referencia ampliamente utilizado. A partir de principios de la década de 2020, EMNIST continúa citándose en cientos de artículos anualmente, y a menudo se utiliza en entornos educativos para enseñar conceptos de aprendizaje profundo.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·machine-learning·computer-vision
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial