Traduit de l'anglais

La base de données MNIST est une vaste collection de 70 000 images de chiffres manuscrits, largement utilisée pour l'entraînement et le test de systèmes d'apprentissage automatique et de traitement d'images. Elle a été créée en réorganisant des échantillons provenant des ensembles de données originaux du NIST et est devenue une référence fondamentale dans ce domaine.

La base de données MNIST (Modified National Institute of Standards and Technology database) est une grande base de données de chiffres manuscrits couramment utilisée pour l'entraînement de divers systèmes de traitement d'images. Elle est également largement utilisée pour l'entraînement et les tests dans le domaine de l'apprentissage automatique. La base de données a été créée en « recombinant » les échantillons des ensembles de données originaux du NIST. Les créateurs estimaient que les ensembles de données d'entraînement originaux, provenant d'employés du Bureau du recensement américain, et les ensembles de données de test, provenant d'étudiants américains du secondaire, n'étaient pas adaptés aux expériences d'apprentissage automatique. Les images en noir et blanc du NIST ont été normalisées pour s'adapter à une boîte englobante de 28x28 pixels et ont été lissées (anti-aliasing), ce qui a introduit des niveaux de gris.

La base de données MNIST contient 60 000 images d'entraînement et 10 000 images de test. La moitié de l'ensemble d'entraînement et la moitié de l'ensemble de test provenaient de l'ensemble d'entraînement du NIST, tandis que l'autre moitié de chacun provenait de l'ensemble de test du NIST. Les créateurs originaux conservent une liste de méthodes testées sur la base. Dans leur article original, ils utilisaient une machine à vecteurs de support pour obtenir un taux d'erreur de 0,8 %.

Historique

Base de données USPS

En 1988, un ensemble de données de chiffres a été construit à partir du service postal américain. Il contenait des images en niveaux de gris de 16x16 pixels de chiffres manuscrits numérisés à partir de codes postaux sur le courrier américain transitant par le bureau de poste de Buffalo, dans l'État de New York. L'ensemble d'entraînement comptait 7 291 images et l'ensemble de test 2 007, soit un total de 9 298 images. Les deux ensembles contenaient des chiffres ambigus, impossibles à classer et mal classés. Cet ensemble de données a été utilisé pour entraîner et évaluer le réseau neuronal LeNet en 1989. La tâche était difficile ; sur l'ensemble de test, deux humains avaient un taux d'erreur moyen de 2,5 %.

Base de données spéciale

À la fin des années 1980, le Bureau du recensement s'est intéressé à la numérisation automatique des formulaires de recensement manuscrits et a chargé le groupe de reconnaissance d'images du NIST d'évaluer les systèmes d'OCR. Plusieurs années de travail ont abouti à plusieurs « bases de données spéciales ». Pour MNIST, les bases pertinentes sont la base spéciale 1 (SD-1), publiée en mai 1990, la base spéciale 3 (SD-3), publiée en février 1992, et la base spéciale 7 (SD-7), ou données de test 1 du NIST (TD-1), publiée en avril 1992. Elles ont été distribuées sur CD-ROM au format ISO-9660. Les données ont été obtenues en demandant à des personnes de remplir des « formulaires d'écriture manuscrite » (HSF), puis en numérisant les formulaires et en segmentant les caractères alphanumériques. Chaque scripteur a rempli un seul formulaire HSF.

Chaque formulaire HSF contient plusieurs champs de saisie, notamment des champs pour le nom et la date, un champ pour la ville, 28 champs pour les chiffres, un champ pour les lettres majuscules, un champ pour les lettres minuscules et un paragraphe de texte libre sur la Constitution. Chaque formulaire HSF a été numérisé à une résolution de 300 points par pouce (11,8 points par millimètre).

Les bases SD-1 et SD-3 ont été construites à partir du même ensemble de formulaires HSF, remplis par 2 100 des 3 400 employés permanents du Bureau du recensement dans le cadre du recensement américain de 1990. La SD-1 contenait les champs de saisie de données segmentés, mais pas les caractères alphanumériques segmentés. La SD-3 contenait des images binaires de 128x128 pixels des caractères alphanumériques segmentés, avec 223 125 chiffres, 44 951 lettres majuscules et 45 313 lettres minuscules.

La SD-7 (ou TD-1) était l'ensemble de test, contenant 58 646 images binaires de 128x128 pixels écrites par 500 étudiants du secondaire de Bethesda, dans le Maryland, décrites comme des « étudiants en mathématiques et en sciences dans un lycée lors d'un exercice court en classe ». Chaque image était accompagnée d'un identifiant entier unique pour l'identité du scripteur. La SD-7 a été publiée sans étiquettes sur CD-ROM, les étiquettes étant publiées plus tard sur disquettes. Elle ne contenait pas les formulaires HSF. Le taux d'erreur humain sur la SD-7 était de 1,5 %.

La SD-3 était beaucoup plus propre et plus facile à reconnaître que la SD-7. Le chiffre sept barré à l'européenne était beaucoup plus fréquent dans la SD-7 que dans la SD-3. On soupçonnait que la SD-3 avait été produite par des personnes plus motivées que celles de la SD-7, et que le segmentateur de caractères de la SD-3, une conception plus ancienne, échouait plus souvent, filtrant ainsi les cas les plus difficiles. Les systèmes d'apprentissage automatique entraînés et validés sur la SD-3 subissaient des baisses de performance significatives sur la SD-7, le taux d'erreur passant de moins de 1 % à environ 10 %.

En 1992, le NIST et le Bureau du recensement ont parrainé un concours et une conférence pour déterminer l'état de l'art. Les équipes ont reçu la SD-3 comme ensemble d'entraînement avant le 23 mars et la SD-7 comme ensemble de test avant le 13 avril, et devaient soumettre leurs systèmes de classification de la SD-7 avant le 27 avril. Au total, 45 algorithmes ont été soumis par 26 entreprises de 7 pays. Les 27 et 28 mai, toutes les parties se sont réunies à Gaithersburg, dans le Maryland, pour la première conférence sur les systèmes d'OCR du recensement, avec des observateurs du FBI, de l'IRS et de l'USPS. L'entrée gagnante n'utilisait pas la SD-3 pour l'entraînement mais un ensemble d'entraînement propriétaire beaucoup plus vaste, évitant ainsi le décalage de distribution. Parmi les 25 entrées qui utilisaient la SD-3, le gagnant était un classificateur du plus proche voisin utilisant une métrique artisanale invariante aux transformations euclidiennes.

La SD-19 a été publiée en 1995 comme une compilation de la SD-1, de la SD-3, de la SD-7 et d'autres données. Elle contenait 814 255 images binaires de caractères alphanumériques et 4 169 formulaires HSF, y compris les 500 formulaires HSF utilisés pour générer la SD-7. Elle a été mise à jour en 2016.

Construction de MNIST

MNIST a été construite quelque temps avant l'été 1994 en mélangeant des images binaires de 128x128 pixels provenant de la SD-3 et de la SD-7. Plus précisément, les créateurs ont d'abord pris toutes les images de la SD-7 et les ont divisées en un ensemble d'entraînement et un ensemble de test, chacun provenant de 250 scripteurs différents, ce qui a donné près de 30 000 images dans chaque ensemble. Ils ont ensuite ajouté des images de la SD-3 jusqu'à ce que chaque ensemble contienne exactement 60 000 images.

Chaque image a été normalisée en taille pour tenir dans une boîte de 20x20 pixels tout en préservant son ratio hauteur/largeur, puis lissée (anti-aliasing) pour produire des niveaux de gris. Ensuite, l'image a été placée dans une image de 28x28 pixels en la translatant jusqu'à ce que le centre de masse des pixels soit au centre de l'image. Les détails de la procédure de sous-échantillonnage ont été reconstitués plus tard.

L'ensemble d'entraînement et l'ensemble de test comptaient chacun 60 000 échantillons, mais 50 000 échantillons de l'ensemble de test ont été écartés, ne laissant que les échantillons indexés de 24 476 à 34 475, soit exactement 10 000 échantillons dans l'ensemble de test.

Versions ultérieures

En 2019, l'ensemble de test complet de 60 000 images a été restauré pour construire QMNIST, qui contient 60 000 images dans l'ensemble d'entraînement et 60 000 dans l'ensemble de test.

MNIST étendu (EMNIST) est un ensemble de données plus récent développé et publié par le NIST comme successeur de MNIST, publié en 2017. Alors que MNIST ne contenait que des chiffres manuscrits, EMNIST a été construit à partir de toutes les images de la SD-19, y compris les lettres et les chiffres, et constitue un banc d'essai plus difficile pour la recherche en apprentissage profond et en intelligence artificielle.

Héritage

MNIST est devenu un banc d'essai fondamental dans l'enseignement et la recherche en apprentissage automatique, souvent utilisé comme premier test pour de nouveaux algorithmes et architectures. Sa simplicité et sa petite taille le rendent idéal pour enseigner les concepts d'entraînement de réseaux de neurones et d'évaluation. L'adoption généralisée de cet ensemble de données a influencé le développement de bancs d'essai ultérieurs et a contribué à la croissance du domaine, y compris les progrès en apprentissage profond et en IA générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·machine-learning·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique