Traduit de l'anglais

EMNIST (Extended MNIST) est un ensemble de données de chiffres et de lettres manuscrits, contenant 240 000 images d'entraînement, utilisé pour la recherche en apprentissage automatique et en vision par ordinateur.

EMNIST (Extended MNIST) est un ensemble de données de caractères manuscrits qui étend l'ensemble de données original MNIST de chiffres pour inclure à la fois des chiffres et des lettres majuscules et minuscules. Il contient 240 000 images d'entraînement et 40 000 images de test, chacune étant une image en niveaux de gris de 28x28. EMNIST est largement utilisé dans la recherche en apprentissage automatique et apprentissage profond pour des tâches telles que la reconnaissance de caractères et l'évaluation comparative d'algorithmes de classification.

L'ensemble de données a été introduit en 2017 par Gregory Cohen, Saeed Afshar, Jonathan Tapson et André van Schaik à l'Institut MARCS pour le cerveau, le comportement et le développement, à l'Université Western Sydney. Il a été créé en convertissant la base de données spéciale 19 du NIST, qui contient des échantillons manuscrits de plus de 3 600 rédacteurs, dans le même format que MNIST. EMNIST fournit un benchmark plus difficile que MNIST car il inclut des lettres, qui ont plus de classes et une plus grande similarité visuelle entre certains caractères (par exemple, 'O' et '0', 'I' et 'l').

Variantes et Divisions

EMNIST est disponible en plusieurs variantes, chacune avec une structure de classes différente. La plus courante est EMNIST Letters, qui contient 26 classes (A-Z) et 145 600 images d'entraînement. D'autres variantes incluent EMNIST Digits (10 classes, 280 000 images d'entraînement), EMNIST Balanced (47 classes, 112 800 images d'entraînement), EMNIST ByClass (62 classes, 697 932 images d'entraînement) et EMNIST ByMerge (47 classes, 697 932 images d'entraînement). Les variantes Balanced et ByMerge fusionnent certaines casse de lettres (par exemple, 'C' et 'c') pour réduire l'ambiguïté, tandis que ByClass maintient toutes les classes séparées.

Utilisation dans la Recherche

EMNIST est devenu un benchmark standard pour évaluer les architectures de réseaux neuronaux et les techniques d'entraînement. Il est souvent utilisé pour tester des améliorations dans augmentation de données, abandon, normalisation par lots et d'autres méthodes de régularisation. Les chercheurs utilisent également EMNIST pour étudier l'apprentissage par transfert, où des modèles pré-entraînés sur des ensembles de données plus volumineux sont affinés sur EMNIST. L'ensemble de données est inclus dans des bibliothèques populaires d'apprentissage automatique telles que PyTorch et TensorFlow, ce qui le rend facilement accessible pour l'expérimentation.

Relation avec MNIST

EMNIST est conçu comme un remplacement direct de MNIST, avec la même taille et le même format d'image. Cependant, l'inclusion de lettres augmente la difficulté : le nombre de classes passe de 10 à jusqu'à 62, et la similarité inter-classes est plus élevée. Cela fait d'EMNIST un benchmark plus réaliste pour la reconnaissance de l'écriture manuscrite dans des applications du monde réel, telles que le tri du courrier postal et le traitement de formulaires. De nombreuses études rapportent que les modèles atteignant une précision quasi parfaite sur MNIST voient une baisse significative sur EMNIST, soulignant la nécessité de méthodes plus robustes.

Limitations et Extensions

Malgré sa portée plus large, EMNIST présente encore des limitations. Il est dérivé d'une seule source (NIST), il peut donc ne pas capturer la diversité complète des styles d'écriture dans différentes populations. Les images sont également prétraitées pour être centrées et normalisées, ce qui réduit la variabilité. Pour remédier à ces problèmes, les chercheurs ont créé des extensions telles que Fashion-MNIST (images de vêtements) et Kuzushiji-MNIST (caractères japonais), mais EMNIST reste une référence largement utilisée. Au début des années 2020, EMNIST continue d'être cité dans des centaines d'articles chaque année, et il est souvent utilisé dans des contextes éducatifs pour enseigner les concepts de apprentissage profond.

Voir Aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·machine-learning·computer-vision
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique