Fashion-MNIST est un ensemble de données de référence largement utilisé dans les domaines de l'apprentissage automatique et de l'apprentissage profond. Il se compose de 70 000 images en niveaux de gris de produits de mode, chacune de 28 sur 28 pixels, divisées en 60 000 images d'entraînement et 10 000 images de test. L'ensemble de données a été créé par Zalando Research en 2017 pour servir d'alternative plus difficile et plus réaliste à l'ensemble de données MNIST original de chiffres manuscrits, qui était devenu saturé avec une précision de classification très élevée. Fashion-MNIST est conçu pour tester la capacité des modèles de réseaux de neurones à distinguer dix catégories de vêtements distinctes, ce qui en fait un outil standard pour évaluer les algorithmes de classification d'images.
Les dix classes de l'ensemble de données sont : T-shirt/haut, pantalon, pull, robe, manteau, sandale, chemise, basket, sac et botte de cheville. Chaque image est une photographie en niveaux de gris centrée et à basse résolution qui inclut un certain bruit de fond, reflétant plus fidèlement les conditions du monde réel que les chiffres propres et centrés de MNIST. Comme les images sont petites et que l'ensemble de données est de taille modérée, Fashion-MNIST est peu coûteux en calcul pour l'entraînement, mais il pose un problème suffisamment difficile pour différencier les modèles avec différentes architectures et hyperparamètres.
Historique et motivation
Fashion-MNIST a été introduit dans un article de 2017 par Han Xiao, Kashif Rasul et Roland Vollgraf, chercheurs chez Zalando Research, la division d'apprentissage automatique de l'entreprise allemande de commerce électronique de mode Zalando. La motivation principale était l'observation que l'ensemble de données MNIST original, publié en 1998 par Yann LeCun, Corinna Cortes et Christopher Burges, était devenu trop facile pour les classificateurs modernes. De nombreux modèles atteignaient une précision supérieure à 99 %, ce qui rendait difficile de discerner des améliorations significatives dans la conception des algorithmes. Les auteurs visaient à créer un ensemble de données qui conserve le même format et la même complexité que MNIST - images en niveaux de gris 28x28, 10 classes et la même répartition entraînement/test - mais avec une tâche de reconnaissance visuelle plus difficile.
Les images proviennent du catalogue Zalando, où les photos de produits ont été converties en niveaux de gris, redimensionnées et recadrées pour centrer les articles. L'ensemble de données a été publié sous la licence MIT, permettant une utilisation libre dans des applications académiques et commerciales. Depuis sa publication, Fashion-MNIST est devenu l'un des ensembles de données les plus cités dans la recherche en apprentissage automatique, avec des milliers d'articles l'utilisant pour évaluer les réseaux de neurones convolutifs, les machines à vecteurs de support et d'autres classificateurs.
Caractéristiques de l'ensemble de données
Chaque image de Fashion-MNIST est un tableau de pixels 28x28, avec des valeurs de pixels allant de 0 (noir) à 255 (blanc). Les images sont stockées dans un format identique à celui de MNIST original, ce qui rend trivial de remplacer un ensemble de données par l'autre dans les codes existants. L'ensemble d'entraînement contient 6 000 images par classe, et l'ensemble de test contient 1 000 images par classe, garantissant une représentation équilibrée dans les dix catégories.
Une caractéristique notable est la présence de variation intra-classe. Par exemple, la classe « chemise » comprend à la fois des chemises à manches courtes et à manches longues, et la classe « sac » comprend des sacs à main, des sacs à dos et des pochettes. Cette variabilité oblige les modèles à apprendre des caractéristiques plus robustes plutôt que de se fier à des motifs de pixels simples. De plus, certaines classes sont visuellement similaires entre elles, comme les pulls, les manteaux et les chemises, ce qui augmente la difficulté de la tâche de classification par rapport aux formes de chiffres distinctes de MNIST.
Utilisation dans la recherche en apprentissage automatique
Fashion-MNIST est couramment utilisé comme ensemble de données de référence pour évaluer de nouvelles architectures de réseaux de neurones, des techniques d'optimisation et des méthodes de régularisation. Comme l'ensemble de données est suffisamment petit pour être entraîné sur un seul GPU en quelques minutes, les chercheurs peuvent itérer rapidement. Il est également fréquemment utilisé dans des contextes éducatifs pour enseigner les concepts de apprentissage profond, car il offre une tâche visuelle plus intéressante que les chiffres manuscrits tout en restant gérable pour les étudiants.
Les résultats de référence typiques sur Fashion-MNIST montrent qu'un réseau de neurones convolutif bien réglé peut atteindre une précision d'environ 93 à 95 %, tandis qu'un modèle de régression logistique simple atteint environ 85 %. Cet écart met en évidence l'avantage des approches d'apprentissage profond pour cette tâche. L'ensemble de données a également été utilisé pour tester l'apprentissage par transfert, les stratégies d'augmentation de données et la robustesse adversarial, car ses images sont plus complexes que MNIST mais encore assez simples pour des expériences contrôlées.
Comparaison avec MNIST original
L'ensemble de données MNIST original se compose de chiffres manuscrits de 0 à 9, collectés auprès d'employés du Bureau du recensement des États-Unis et d'élèves du secondaire. Alors que MNIST est presque résolu, avec de nombreux modèles dépassant 99,5 % de précision, Fashion-MNIST voit généralement des précisions maximales autour de 96 à 97 %, laissant plus de place à l'amélioration. Les images de mode contiennent également plus de complexité de contours et de variation de texture, ce qui en fait un meilleur proxy pour des tâches de vision par ordinateur du monde réel telles que la reconnaissance de produits dans le commerce électronique.
Une autre différence est la source des données. Les chiffres de MNIST ont été écrits et scannés manuellement, tandis que les images de Fashion-MNIST sont dérivées de photographies de produits professionnelles, qui incluent des variations d'éclairage et des éléments d'arrière-plan. Cela rend Fashion-MNIST plus représentatif des applications pratiques, tout en conservant la même basse résolution et le même format simple qui facilitent la visualisation et le traitement.
Limites et extensions
Malgré sa popularité, Fashion-MNIST a des limites. La résolution de 28x28 est trop faible pour une classification fine, et le format en niveaux de gris élimine les informations de couleur qui pourraient être utiles dans la reconnaissance de mode réelle. Certains chercheurs ont critiqué l'ensemble de données pour être trop facile par rapport à des références modernes comme CIFAR-10 ou ImageNet, qui impliquent des images naturelles avec une résolution plus élevée et plus de classes. Néanmoins, Fashion-MNIST reste un outil précieux pour le prototypage rapide et à des fins éducatives.
Les extensions de l'ensemble de données incluent des variantes de Fashion-MNIST avec du bruit ajouté, des rotations ou des perturbations adversariales, qui sont utilisées pour tester la robustesse des modèles. Certains travaux ont également combiné Fashion-MNIST avec d'autres ensembles de données pour créer des références d'apprentissage multitâche. La simplicité de l'ensemble de données et son étiquetage clair en font un point de départ fiable pour les chercheurs explorant de nouvelles idées en intelligence artificielle avant de passer à des ensembles de données plus complexes.
Impact et héritage
Fashion-MNIST a eu un impact significatif sur la communauté de l'apprentissage automatique en fournissant une référence standardisée et accessible qui comble le fossé entre les problèmes jouets et les applications du monde réel. Il a été intégré dans les principales bibliothèques d'apprentissage profond telles que TensorFlow, PyTorch et Keras, permettant aux utilisateurs de charger l'ensemble de données avec une seule ligne de code. Son adoption généralisée en a fait une norme de facto pour les cours d'introduction à la vision par ordinateur et pour comparer les performances des modèles nouvellement proposés.
Les créateurs de l'ensemble de données ont également fourni un rapport technique détaillé et un dépôt GitHub avec du code pour charger et visualiser les données, ce qui a facilité son adoption rapide. Au début des années 2020, Fashion-MNIST continue d'être cité dans des centaines d'articles de recherche chaque année, et il reste une référence recommandée pour quiconque développe des algorithmes de classification d'images dans le domaine de la basse résolution.