Traduit de l'anglais

Kuzushiji-MNIST est un ensemble de données de 70 000 images en niveaux de gris de caractères hiragana japonais écrits à la main, conçu comme un remplacement direct de l'ensemble de données MNIST original pour la recherche en apprentissage automatique.

Kuzushiji-MNIST est un ensemble de données de référence pour la classification d'images dans le apprentissage automatique et le apprentissage profond. Il se compose de 70 000 images en niveaux de gris de 28x28 pixels de caractères hiragana japonais manuscrits, réparties en un ensemble d'entraînement de 60 000 échantillons et un ensemble de test de 10 000 échantillons. Cet ensemble de données a été créé comme une alternative moderne à l'ensemble de données MNIST classique de chiffres manuscrits, largement utilisé depuis la fin des années 1990 pour évaluer les algorithmes de réseaux de neurones. Kuzushiji-MNIST conserve les mêmes dimensions d'image, le même format de données et le même nombre de classes (10) que le MNIST original, ce qui en fait un remplacement direct pour les chercheurs souhaitant tester des modèles sur une tâche plus difficile et culturellement significative.

L'ensemble de données a été introduit en 2018 par une équipe de chercheurs de l'Université de Tokyo et de l'Institut national de littérature japonaise, dirigée par Tarin Clanuwat et ses collègues. Il a été publié aux côtés de deux ensembles de données connexes : Kuzushiji-49, qui contient 49 classes de caractères hiragana, et Kuzushiji-Kanji, qui comprend 3 832 classes de kanji cursifs. La motivation principale était de résoudre le problème de la reconnaissance optique de caractères (OCR) pour les documents historiques japonais, rédigés dans une écriture cursive connue sous le nom de kuzushiji. Cette écriture a été largement utilisée du VIIIe au XIXe siècle, mais a été largement abandonnée après les réformes éducatives de 1900, laissant des millions de textes historiques illisibles pour les locuteurs japonais modernes.

Conception et Construction

Les images de Kuzushiji-MNIST proviennent d'un vaste corpus de livres et manuscrits historiques japonais numérisés. Les chercheurs ont utilisé une combinaison de segmentation automatique et d'annotation manuelle pour extraire des images de caractères individuels de ces documents. Chaque image a ensuite été redimensionnée à 28x28 pixels et convertie en niveaux de gris, avec des valeurs de pixels allant de 0 (noir) à 255 (blanc), correspondant exactement au format de l'ensemble de données MNIST original. Les 10 classes correspondent aux dix caractères hiragana les plus courants du corpus, à savoir : 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're' et 'wo'. Ces caractères ont été choisis pour équilibrer la fréquence des classes et la distinction visuelle, garantissant que la tâche de classification n'est ni triviale ni impossible à réaliser.

L'ensemble de données est distribué dans un format binaire identique au MNIST original, avec des fichiers séparés pour les images d'entraînement, les étiquettes d'entraînement, les images de test et les étiquettes de test. Cette compatibilité permet aux chercheurs d'utiliser le code et les pipelines existants conçus pour MNIST sans modification, simplement en remplaçant les nouveaux fichiers de données. Les créateurs ont également fourni un script de chargement Python et un README détaillé pour faciliter l'intégration dans des cadres courants de apprentissage profond tels que PyTorch et TensorFlow.

Performance de Référence

Depuis sa publication, Kuzushiji-MNIST est devenu une référence standard pour évaluer les modèles de classification d'images, en particulier dans le contexte de la augmentation de données et des architectures de réseaux résiduels. La tâche est nettement plus difficile que le MNIST original, car les caractères hiragana présentent une plus grande variation intra-classe et une similarité visuelle entre différentes classes. Par exemple, les caractères pour 'su' et 'tsu' sont souvent confondus même par des lecteurs humains peu familiers avec le kuzushiji. Par conséquent, les modèles simples qui atteignent une précision quasi parfaite sur MNIST performent généralement beaucoup moins bien sur Kuzushiji-MNIST, ce qui en fait un test plus sensible de la capacité et de la généralisation des modèles.

Les résultats de pointe sur Kuzushiji-MNIST ont été obtenus à l'aide de réseaux de neurones convolutifs (CNN) avec normalisation par lots et régularisation par abandon. En 2024, la meilleure précision de test rapportée est d'environ 99,5 %, obtenue par un ensemble de réseaux résiduels avec une augmentation de données extensive. Cependant, l'ensemble de données reste difficile pour les modèles légers et pour les approches reposant sur des caractéristiques artisanales, qui plafonnent souvent à des précisions inférieures à 95 %. La référence a également été utilisée pour étudier les effets des stratégies de planification du taux d'apprentissage et de initialisation des poids, ainsi que la robustesse des modèles au bruit d'étiquetage.

Applications et Impact

L'application principale de Kuzushiji-MNIST est de servir d'outil de recherche pour faire progresser la technologie OCR des documents historiques japonais. Le projet Kuzushiji plus large, dont est dérivé l'ensemble de données, vise à numériser et rendre consultables les millions de livres et manuscrits écrits en kuzushiji qui sont actuellement inaccessibles au grand public. En fournissant une référence standardisée, l'ensemble de données a permis aux chercheurs du monde entier de développer et de comparer des algorithmes de reconnaissance de caractères cursifs, une étape cruciale vers la transcription automatisée de ces textes.

Au-delà de son application directe, Kuzushiji-MNIST a été adopté comme banc d'essai polyvalent dans l'éducation et la recherche en apprentissage automatique. Sa similarité avec MNIST en fait une introduction accessible à la classification d'images, tandis que sa difficulté accrue encourage l'exploration de techniques plus avancées. L'ensemble de données a été cité dans des centaines d'articles académiques et est inclus dans des bibliothèques et des supports de cours populaires d'apprentissage automatique. Il a également été utilisé pour évaluer la transférabilité de modèles entraînés sur d'autres ensembles de données de caractères, tels que l'alphabet latin ou les caractères chinois, fournissant des informations sur la généralisation inter-écritures.

Ensembles de Données Connexes et Extensions

Les créateurs de Kuzushiji-MNIST ont également publié Kuzushiji-49, qui inclut les 49 caractères hiragana, et Kuzushiji-Kanji, qui couvre 3 832 caractères kanji. Ces ensembles de données sont plus grands et plus complexes, Kuzushiji-Kanji contenant plus de 140 000 images. Ils sont destinés à des tâches OCR plus avancées et à l'entraînement de modèles capables de gérer la gamme complète de caractères trouvés dans les documents historiques. De plus, le projet Kuzushiji a publié un grand corpus annoté de textes historiques, connu sous le nom de Kuzushiji Dataset, qui comprend des images de pages entières avec des boîtes englobantes au niveau des caractères. Cette ressource a été utilisée dans des compétitions et des efforts de recherche collaborative pour développer des systèmes de transcription de bout en bout.

Dans la communauté de l'apprentissage automatique, Kuzushiji-MNIST a inspiré des efforts similaires pour créer des références culturellement diverses, tels que l'ensemble de données EMNIST pour les lettres manuscrites et l'ensemble de données Fashion-MNIST pour les images de vêtements. Ces ensembles de données partagent le même format et la même taille que le MNIST original, permettant une comparaison directe des performances des modèles à travers différents domaines. Le succès de Kuzushiji-MNIST a mis en évidence la valeur de la préservation et de la numérisation des écritures historiques, et il continue de servir de pont entre la préservation du patrimoine culturel et la recherche moderne en intelligence artificielle.

Voir Aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·image-classification·japanese-ocr·benchmark
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique