Traduit de l'anglais

La base de données MNIST est un grand ensemble de données de 70 000 chiffres manuscrits, couramment utilisé pour l'entraînement et le test de systèmes de traitement d'images et d'apprentissage automatique. Elle a été créée en réassemblant des échantillons des ensembles de données originaux du NIST et normalisée en images en niveaux de gris de 28x28 pixels.

La base de données MNIST (base de données de l'Institut national des normes et de la technologie modifié) est une grande base de données de chiffres manuscrits couramment utilisée pour entraîner divers systèmes de traitement d'images. La base est également largement utilisée pour l'entraînement et les tests dans le domaine de l'apprentissage automatique. Elle a été créée en « recombinant » les échantillons des ensembles de données originaux du NIST. Les créateurs estimaient que, puisque l'ensemble d'entraînement du NIST provenait d'employés du Bureau du recensement américain, tandis que l'ensemble de test provenait d'élèves du secondaire américains, elle n'était pas bien adaptée aux expériences d'apprentissage automatique. De plus, les images en noir et blanc du NIST ont été normalisées pour tenir dans une boîte englobante de 28x28 pixels et anti-aliasées, ce qui a introduit des niveaux de gris.

La base de données MNIST contient 60 000 images d'entraînement et 10 000 images de test. La moitié de l'ensemble d'entraînement et la moitié de l'ensemble de test proviennent de l'ensemble d'entraînement du NIST, tandis que l'autre moitié de l'ensemble d'entraînement et l'autre moitié de l'ensemble de test proviennent de l'ensemble de test du NIST. Les créateurs originaux de la base tiennent une liste de certaines des méthodes testées sur celle-ci. Dans leur article original, ils utilisent une machine à vecteurs de support pour obtenir un taux d'erreur de 0,8 %. L'ensemble de données MNIST original contient au moins 4 étiquettes incorrectes.

Historique

Le développement de MNIST a été précédé par plusieurs ensembles de données et références associés. En 1988, un ensemble de données de chiffres provenant du service postal américain a été construit, contenant des images en niveaux de gris de 16x16 pixels numérisées à partir de codes postaux manuscrits sur le courrier américain passant par le bureau de poste de Buffalo, New York. L'ensemble d'entraînement comptait 7 291 images et l'ensemble de test 2 007, soit un total de 9 298. Les ensembles d'entraînement et de test contenaient tous deux des données ambiguës, non classifiables et mal classifiées. L'ensemble a été utilisé pour entraîner et évaluer le LeNet de 1989, un réseau de neurones pionnier. Sur l'ensemble de test, deux humains ont commis des erreurs à un taux moyen de 2,5 %.

Base de données spéciale

À la fin des années 1980, le Bureau du recensement s'intéressait à la numérisation automatique des formulaires de recensement manuscrits, il a donc sollicité le groupe de reconnaissance d'images (IRG) du NIST pour évaluer les systèmes d'OCR. Plusieurs années de travail ont abouti à plusieurs « bases de données spéciales » et références. D'une importance particulière pour MNIST sont la base de données spéciale 1 (SD-1), publiée en mai 1990, la base de données spéciale 3 (SD-3), publiée en février 1992, et la base de données spéciale 7 (SD-7), ou données de test NIST 1 (TD-1), publiée en avril 1992. Elles ont été publiées sur des CD-ROM ISO-9660. Elles ont été obtenues en demandant à des personnes d'écrire sur des « formulaires d'échantillons d'écriture » (HSF), puis en numérisant les HSF, puis en segmentant les caractères alphanumériques. Chaque scripteur a écrit un seul HSF.

Chaque HSF contient plusieurs champs de saisie, dans lesquels il était demandé aux personnes d'écrire. Il y a 34 champs : des entrées de nom et de date, un champ ville/état, 28 champs de chiffres, un champ en majuscules, un champ en minuscules et un paragraphe de texte non contraint sur la Constitution. Chaque HSF a été scanné à une résolution de 300 points par pouce (11,8 points par millimètre). SD-1 et SD-3 ont été construits à partir du même ensemble de HSF par 2 100 des 3 400 agents permanents du recensement dans le cadre du recensement américain de 1990. SD-1 contenait les champs de saisie segmentés, mais pas les caractères alphanumériques segmentés. SD-3 contenait des images binaires 128x128 numérisées à partir de caractères alphanumériques segmentés, avec 223 125 chiffres, 44 951 lettres majuscules et 45 313 lettres minuscules.

SD-7 ou TD-1 était l'ensemble de test, et il contenait 58 646 images binaires 128x128 écrites par 500 élèves du secondaire à Bethesda, Maryland. Ils ont été décrits comme des « élèves en mathématiques et en sciences dans un lycée lors d'un court exercice en classe ». Chaque image est accompagnée d'un identifiant entier unique pour l'identité de son scripteur. SD-7 a été publié sans étiquettes sur CD-ROM, et les étiquettes ont ensuite été publiées sur des disquettes. Il ne contenait pas les HSF. SD-7 était suffisamment difficile pour que le taux d'erreur humain sur celui-ci soit de 1,5 %. SD-3 était beaucoup plus propre et plus facile à reconnaître que les images de SD-7. Le sept barré européen (7) est beaucoup plus abondant dans SD-7 que dans SD-3. On soupçonnait que SD-3 avait été produit par des personnes plus motivées que celles qui avaient produit SD-7. De plus, le segmentateur de caractères pour SD-3 était une conception plus ancienne que celle de SD-7 et échouait plus souvent. On soupçonnait que les instances plus difficiles avaient été filtrées lors de la construction de SD-3, car les instances difficiles ne parvenaient même pas à passer le segmentateur. Il a été constaté que les systèmes d'apprentissage automatique entraînés et validés sur SD-3 subissaient des baisses significatives de performance sur SD-7, passant d'un taux d'erreur de moins de 1 % à environ 10 %.

En 1992, le NIST et le Bureau du recensement ont parrainé un concours et une conférence pour déterminer l'état de l'art dans cette industrie. Lors du concours, les équipes ont reçu SD-3 comme ensemble d'entraînement avant le 23 mars, SD-7 comme ensemble de test avant le 13 avril, et devaient soumettre un ou plusieurs systèmes pour classer SD-7 avant le 27 avril. Un total de 45 algorithmes a été soumis par 26 entreprises de 7 pays différents. Les 27 et 28 mai, toutes les parties ayant soumis des résultats se sont réunies à Gaithersburg, Maryland, lors de la première conférence sur les systèmes d'OCR du recensement. Des observateurs du FBI, de l'IRS et de l'USPS étaient présents. L'entrée gagnante n'utilisait pas SD-3 pour l'entraînement, mais un ensemble d'entraînement propriétaire beaucoup plus grand, et n'était donc pas affectée par le changement de distribution. Parmi les 25 entrées qui utilisaient SD-3 pour l'entraînement, l'entrée gagnante était un classifieur du plus proche voisin utilisant une métrique artisanale invariante aux transformations euclidiennes.

SD-19 a été publié en 1995, comme une compilation de SD-1, SD-3, SD-7 et de quelques données supplémentaires. Il contenait 814 255 images binaires de caractères alphanumériques et des images binaires de 4 169 HSF, y compris les 500 HSF utilisés pour générer SD-7. Il a été mis à jour en 2016.

MNIST

MNIST a été construite avant l'été 1994. Elle a été construite en mélangeant des images binaires 128x128 de SD-3 et SD-7. Plus précisément, ils ont d'abord pris toutes les images de SD-7 et les ont divisées en un ensemble d'entraînement et un ensemble de test, chacun provenant de 250 scripteurs. Cela a donné près de 30 000 images dans chaque ensemble. Ils ont ensuite ajouté plus d'images de SD-3 jusqu'à ce que chaque ensemble contienne exactement 60 000 images.

Chaque image a été normalisée en taille pour tenir dans une boîte de 20x20 pixels tout en préservant son rapport hauteur/largeur, et anti-aliasée en niveaux de gris. Ensuite, elle a été placée dans une image de 28x28 en la translatant jusqu'à ce que le centre de masse des pixels soit au centre de l'image. Les détails de la façon dont le sous-échantillonnage a été effectué ont été reconstitués. L'ensemble d'entraînement et l'ensemble de test avaient tous deux initialement 60 000 échantillons, mais 50 000 des échantillons de l'ensemble de test ont été écartés, et seuls les échantillons indexés de 24476 à 34475 ont été utilisés, donnant ainsi seulement 10 000 échantillons dans l'ensemble de test.

Versions ultérieures

En 2019, l'ensemble de test complet de 60 000 échantillons de MNIST a été restauré pour construire QMNIST, qui compte 60 000 images dans l'ensemble d'entraînement et 60 000 dans l'ensemble de test. Extended MNIST (EMNIST) est un ensemble de données plus récent développé et publié par le NIST pour être le successeur (final) de MNIST, publié en 2017. MNIST ne comprenait que des images de chiffres manuscrits. EMNIST a été construit à partir de toutes les images de SD-19, y compris les lettres ainsi que les chiffres, et fournit une référence plus difficile pour la recherche en apprentissage profond et en intelligence artificielle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·machine-learning·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique