Publication du jeu de données MNIST

Traduit de l'anglais

Le jeu de données MNIST est une référence largement utilisée composée de 70 000 images de chiffres manuscrits, créé en remixant les jeux de données du NIST, publié en 1998 pour l'entraînement de modèles d'apprentissage automatique en reconnaissance d'images.

La base de données MNIST (base de données de l'Institut national des normes et de la technologie modifiée) est une vaste collection d'images de chiffres manuscrits, couramment utilisée pour former et tester des systèmes de traitement d'images et d'apprentissage automatique. Créée en rééchantillonnant des échantillons des ensembles de données NIST originaux, elle a été conçue pour remédier aux limitations des données d'entraînement de NIST, qui provenaient d'employés du Bureau du recensement américain, et de ses données de test, provenant d'élèves de lycée américains, ce qui la rendait inadaptée aux expériences d'apprentissage automatique. Les images en noir et blanc ont été normalisées à des boîtes englobantes de 28x28 pixels et anti-aliasées, introduisant des niveaux de gris.

MNIST contient 60,000 images d'entraînement et 10,000 images de test, avec la moitié de chaque ensemble tirée des données d'entraînement de NIST et l'autre moitié de ses données de test. Les créateurs maintiennent une liste de méthodes testées sur l'ensemble de données, et leur article original rapportait un taux d'erreur de 0,8% en utilisant une machine à vecteurs de support. L'ensemble de données MNIST original comprend au moins quatre étiquettes incorrectes, une particularité bien connue.

Prédécesseurs et origines

Avant MNIST, la base de données USPS (1988) fournissait un ensemble de données de chiffres plus petit provenant de codes postaux manuscrits sur du courrier américain. Elle contenait des images en niveaux de gris de 16x16 pixels, avec 7,291 images d'entraînement et 2,007 images de test, totalisant 9,298. Cet ensemble de données incluait des échantillons ambigus et mal classifiés, et était difficile, avec un taux d'erreur humain moyen de 2,5%. Il a été utilisé pour former l'architecture LeNet au début de 1989.

À la fin des années 1980, le Bureau du recensement cherchait à automatiser la numérisation de formulaires manuscrits, engageant le groupe de reconnaissance d'images de NIST pour évaluer les systèmes d'OCR. Leurs travaux ont produit plusieurs bases de données spéciales : SD-1 (1990,, SD-3 (1992, et SD-7 (1992,. Celles-ci ont été construites à partir de formulaires d'échantillons d'écriture manuscrite (HSFs,, scannés à 300 dpi, avec divers champs pour les noms, les chiffres, et les lettres. SD-3 contenait des images binaires de 128x128 pixels d'alphanumériques segmentés, y compris 223,125 chiffres, et était dérivée de travailleurs du recensement. SD-7, l'ensemble de test, avait 58,646 images provenant de 500 élèves de lycée, avec un taux d'erreur humain de 1,5%. Notamment, SD-3 était plus propre et plus facile, mais les systèmes d'apprentissage automatique entraînés sur SD-3 voyaient leurs performances chuter à environ 10% d'erreur sur SD-7, soulignant les décalages de distribution.

Un concours NIST de 1992 utilisait SD-3 comme données d'entraînement et SD-7 comme ensemble de test, avec 45 algorithmes provenant de 26 entreprises. L'entrée gagnante utilisait un ensemble d'entraînement propriétaire, tandis que le meilleur parmi les systèmes entraînés sur SD-3 était un classifieur de plus proche voisin avec une métrique invariante. SD-19 (1995) combinait plusieurs bases de données spéciales, contenant 814,255 images.

Création de MNIST

Quelque temps avant l'été 1994, MNIST a été construite à partir de SD-3 et SD-7. Les créateurs ont divisé les images de SD-7 en ensembles d'entraînement et de test, chacun provenant de 250 scripteurs, produisant près de 30,000 images. Ils ont ensuite augmenté chacun avec des images de SD-3 pour atteindre 60,000 échantillons par ensemble. Toutes les images ont été normalisées en taille à une boîte de 20x20 pixels, préservant le rapport d'aspect, et anti-aliasées en niveaux de gris, puis centrées dans une image de 28x28 pixels en ajustant au centre de masse. Les détails du sous-échantillonnage ont été reconstruits plus tard.

Initialement, les ensembles d'entraînement et de test avaient tous deux 60,000 échantillons, mais pour réduire la taille de l'ensemble de test, 50,000 échantillons ont été écartés, ne conservant que les indices 24476 à 34475, résultant en 10,000 images de test.

Évaluation et impact

MNIST est devenue une référence standard dans la recherche en Machine learning et en Deep learning. Elle est largement utilisée pour comparer des algorithmes, des modèles linéaires simples aux modèles complexes de Neural network. La petite taille des images de l'ensemble de données et le nombre modeste de classes la rendent idéale pour le prototypage. Sa disponibilité publique et ses repères clairs en ont fait un outil éducatif courant.

Héritage et successeurs

Extended MNIST (EMNIST) est un ensemble de données plus récent développé par NIST, publié en 2017, en tant que successeur de MNIST. Il inclut des chiffres et des lettres manuscrits, avec des catégories plus larges. En 2019, l'ensemble de test complet de 60,000 échantillons de MNIST a été restauré pour créer QMNIST, fournissant un ensemble de test plus grand pour la recherche. Ces dérivés conservent la structure de MNIST tout en élargissant sa diversité.

Voir aussi

Références

  • Article original sur MNIST par Yann LeCun et al., 1998 (fourni dans les faits sources).
  • Publications de bases de données spéciales de NIST et rapports de repères OCR.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning-dataset·handwritten-digits·benchmark·deep-learning
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique