Traduit de l'anglais

SVHN Cropped est un ensemble de données de référence comprenant plus de 600 000 images de chiffres recadrées provenant de Google Street View, largement utilisé pour l'entraînement et l'évaluation de modèles d'apprentissage profond en reconnaissance de chiffres et en vision par ordinateur.

SVHN Cropped est un ensemble de données de référence largement utilisé dans apprentissage automatique et apprentissage profond, composé de plus de 600 000 images de chiffres recadrées, dérivées de numéros de maisons dans les images de Google Street View. Chaque image est un patch couleur de 32x32 pixels centré sur un seul chiffre (0-9), ce qui rend l'ensemble de données adapté à des tâches telles que la classification de chiffres, l'entraînement de réseaux neuronaux et la recherche sur l'augmentation de données. L'ensemble de données a été introduit par des chercheurs du Stanford AI Lab et de Google en 2011 dans le cadre du projet Street View House Numbers (SVHN), qui visait à améliorer la lecture automatisée des numéros de maisons pour les services de cartographie.

L'ensemble SVHN Cropped est souvent comparé à MNIST, mais il est considéré comme plus difficile en raison de ses caractéristiques d'image naturelles : les chiffres apparaissent avec des arrière-plans variés, des conditions d'éclairage, des distorsions et des chiffres parasites occasionnels sur les bords. L'ensemble complet est divisé en 73 257 images d'entraînement, 26 032 images de test et 531 131 échantillons d'entraînement supplémentaires, qui peuvent être utilisés pour augmenter l'ensemble d'entraînement. Les étiquettes correspondent au chiffre central, et les images sont fournies au format PNG avec des métadonnées de boîtes englobantes des chiffres.

Structure et format de l'ensemble de données

L'ensemble de données SVHN Cropped est organisé en trois fichiers principaux : train.tar.gz, test.tar.gz et extra.tar.gz. Chaque archive contient des images PNG individuelles nommées par un identifiant unique, ainsi qu'un fichier digitStruct.mat (au format MATLAB) qui stocke les coordonnées des boîtes englobantes et les étiquettes pour chaque chiffre. Pour la version recadrée, les images sont déjà centrées sur le chiffre cible, mais les métadonnées incluent toujours les boîtes englobantes d'origine, ce qui peut être utile pour des tâches comme la localisation d'objets ou pour créer des variantes de l'ensemble de données.

Chaque image est de 32x32 pixels avec trois canaux de couleur (RVB), ce qui contraste avec les images MNIST en niveaux de gris de 28x28. La taille plus grande et l'information de couleur offrent une complexité visuelle accrue, faisant de SVHN Cropped un choix privilégié pour tester les architectures convolutionnelles et les conceptions de réseaux résiduels. L'ensemble de données est disponible publiquement à des fins de recherche et peut être téléchargé depuis le site officiel de SVHN ou via des bibliothèques d'apprentissage automatique populaires comme TensorFlow et PyTorch, qui incluent des chargeurs intégrés.

Applications en apprentissage automatique

SVHN Cropped est principalement utilisé pour les tâches de classification de chiffres, servant de référence standard pour évaluer de nouveaux modèles et techniques. Il a été employé dans de nombreuses études pour comparer les performances de diverses architectures, notamment les réseaux de neurones convolutionnels (CNN), les ResNets et les modèles de vision basés sur les transformeurs plus récents. La variabilité naturelle des images de l'ensemble de données en fait un bon proxy pour les tâches de reconnaissance optique de caractères (OCR) du monde réel, comme la lecture de numéros de maisons, de plaques d'immatriculation ou de toute séquence de chiffres sur des photographies.

Au-delà de la classification, SVHN Cropped a été utilisé pour des expériences de apprentissage curriculaire, où les modèles sont entraînés d'abord sur des échantillons plus faciles, et pour tester des stratégies de augmentation de données comme le recadrage aléatoire, la rotation et la variation de couleur. Il sert également de banc d'essai pour la normalisation par lots, le Dropout et d'autres techniques de régularisation, ainsi que pour des études de élagage de modèles et de distillation de connaissances. L'ensemble supplémentaire de 531 131 images est souvent utilisé pour simuler des scénarios d'apprentissage semi-supervisé, où seul un petit sous-ensemble étiqueté est utilisé avec le plus grand pool non étiqueté.

Comparaison avec d'autres ensembles de données

SVHN Cropped est fréquemment comparé à MNIST et CIFAR-10. Contrairement à MNIST, qui contient des chiffres propres, centrés et en niveaux de gris, les chiffres de SVHN Cropped sont en couleur, présentent des échelles et des orientations variées et incluent un fouillis d'arrière-plan. Cela rend SVHN Cropped plus représentatif des conditions du monde réel et plus difficile pour les modèles d'atteindre une haute précision. Par exemple, un CNN simple pourrait atteindre plus de 99 % de précision sur MNIST mais seulement environ 95 à 97 % sur SVHN Cropped sans réglage approfondi ou augmentation.

Comparé à CIFAR-10, qui contient 60 000 images couleur de 32x32 réparties sur 10 classes d'objets, SVHN Cropped offre plus de données d'entraînement (plus de 600 000 images) et une tâche plus ciblée (reconnaissance de chiffres). La taille plus importante de l'ensemble de données est bénéfique pour entraîner des réseaux plus profonds sans surajustement. Les chercheurs utilisent souvent SVHN Cropped comme un juste milieu entre la simplicité de MNIST et la complexité d'ImageNet, fournissant une évaluation rapide mais significative des performances des modèles.

Impact et héritage

L'introduction de SVHN Cropped a contribué à l'avancement du apprentissage profond en fournissant un ensemble de données difficile mais accessible à la communauté de recherche. Il a été cité dans des milliers d'articles et reste un composant standard de nombreux cours et tutoriels d'apprentissage automatique. L'ensemble de données a également souligné la valeur de l'utilisation de données du monde réel provenant de services comme Google Street View, démontrant comment la collecte de données à grande échelle peut stimuler les progrès en intelligence artificielle.

Au fil des ans, SVHN Cropped a été intégré dans diverses suites de référence et classements, comme ceux de Papers with Code, où il continue d'être utilisé pour suivre les performances de pointe. Son influence s'étend au développement de techniques de augmentation de données et à l'évaluation de la robustesse face aux changements de domaine. Au début des années 2020, SVHN Cropped reste une ressource pertinente et largement utilisée, bien que de nouveaux ensembles de données avec des tâches plus complexes aient émergé, il sert toujours de tremplin fondamental pour les chercheurs et les praticiens.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·computer-vision·deep-learning·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique