Traduit de l'anglais

Kuzushiji-MNIST (KMNIST) est un ensemble de données de 70 000 caractères japonais Hiragana écrits à la main, conçu comme un remplacement direct de l'ensemble de données MNIST pour évaluer les modèles de classification d'images.

Kuzushiji-MNIST (KMNIST) est un ensemble de données de 70 000 images en niveaux de gris de caractères Hiragana japonais écrits à la main, chacune de 28x28 pixels. Il a été créé comme une alternative plus difficile à l'ensemble de données classique MNIST, qui contient des chiffres manuscrits. KMNIST est conçu pour être un remplacement direct de MNIST dans les benchmarks d'apprentissage automatique, permettant aux chercheurs de tester des modèles sur une tâche à structure similaire mais à complexité visuelle plus grande en raison de la nature cursive des Hiragana.

L'ensemble de données a été introduit en 2018 par une équipe de chercheurs de l'Université de Tokyo, comprenant Tarin Clanuwat, Mikel Bober-Irizar, Asanobu Kitamoto et Alex Lamb. Il a été dérivé de l'ensemble de données Kuzushiji, qui contient plus de 140 000 images de littérature japonaise classique. Le sous-ensemble KMNIST se concentre sur 10 caractères Hiragana, chacun représenté par 7 000 images (6 000 pour l'entraînement et 1 000 pour le test), reflétant exactement la répartition de MNIST.

Structure de l'ensemble de données

KMNIST suit le même format que MNIST : chaque image est un tableau en niveaux de gris de 28x28 pixels, avec des valeurs de pixels allant de 0 à 255. L'ensemble de données est divisé en 60 000 images d'entraînement et 10 000 images de test. Les 10 caractères inclus sont : 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're' et 'wo'. Ces caractères ont été sélectionnés car ils sont parmi les plus courants dans l'ensemble de données original Kuzushiji et présentent un défi de classification équilibré.

Les créateurs ont intentionnellement évité d'utiliser les mêmes caractères que les chiffres de MNIST, garantissant que les modèles entraînés sur KMNIST ne peuvent pas simplement transférer les caractéristiques apprises de la reconnaissance de chiffres. Les caractères Hiragana ont des motifs de traits et des courbures plus complexes, rendant la tâche plus difficile pour les modèles d'apprentissage automatique traditionnels.

Benchmark et performances

KMNIST est devenu un benchmark standard dans la communauté de l'Machine learning, en particulier pour évaluer les architectures de Neural network. Sur le MNIST original, de nombreux modèles atteignent plus de 99 % de précision, mais KMNIST est significativement plus difficile. Par exemple, un simple Residual Network (ResNet) pourrait atteindre environ 99 % sur MNIST mais seulement environ 95 % sur KMNIST. Cela rend KMNIST utile pour distinguer les modèles qui performent bien sur des tâches simples de ceux qui généralisent à des motifs plus complexes.

Les chercheurs ont utilisé KMNIST pour tester diverses techniques, notamment la Data Augmentation, le Dropout et la Batch Normalization. L'ensemble de données est également inclus dans des bibliothèques d'apprentissage automatique populaires telles que PyTorch et TensorFlow, ce qui facilite son intégration dans les pipelines existants.

Ensembles de données connexes

KMNIST fait partie d'une famille d'ensembles de données de type MNIST, incluant Fashion-MNIST (articles de vêtements) et EMNIST (lettres et chiffres). Ces ensembles de données partagent le même format d'image et la même répartition, permettant une comparaison directe des performances des modèles à travers différents domaines. KMNIST est unique en ce qu'il se concentre sur une écriture non latine, offrant un défi culturel et linguistique que les autres ensembles de données ne présentent pas.

L'ensemble de données original Kuzushiji, dont KMNIST est dérivé, comprend plus de 4 000 caractères différents et est utilisé pour l'analyse de documents historiques. KMNIST simplifie cela en un problème à 10 classes, le rendant accessible pour des fins éducatives et des expérimentations rapides.

Applications et impact

KMNIST a été largement adopté dans la recherche et l'éducation en Deep learning. Il est souvent utilisé dans les cours d'introduction pour enseigner la conception de Convolutional neural network, car il nécessite des architectures plus sophistiquées que MNIST. L'ensemble de données a également été utilisé dans des études sur le Transfer learning et l'adaptation de domaine, où des modèles pré-entraînés sur MNIST sont affinés sur KMNIST.

Au-delà du benchmarking, KMNIST a contribué à la préservation et à l'étude du patrimoine culturel japonais. En rendant les caractères Hiragana classiques accessibles dans un format lisible par machine, il permet une analyse automatisée de documents historiques, ce qui est précieux pour les historiens et les linguistes.

Limitations et orientations futures

Malgré son utilité, KMNIST présente des limitations. Les 10 caractères ne représentent qu'une petite fraction du syllabaire Hiragana complet, et les images sont prétraitées pour correspondre au format de MNIST, ce qui peut perdre une partie de l'information originale sur les traits. De plus, l'ensemble de données est relativement petit par rapport aux ensembles de données modernes à grande échelle, ce qui peut limiter son utilisation pour entraîner des modèles très profonds.

Les travaux futurs pourraient impliquer l'expansion de KMNIST pour inclure plus de caractères ou la création de variantes avec différents prétraitements. En 2025, KMNIST reste un benchmark standard, mais les chercheurs se tournent de plus en plus vers des ensembles de données plus complexes comme CIFAR-10 ou ImageNet pour évaluer les modèles de pointe. Néanmoins, KMNIST continue de servir d'outil précieux pour le prototypage rapide et les fins éducatives.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·machine-learning·japanese-handwriting·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique