Traduit de l'anglais

SVHN Full est un ensemble de données de 604 388 images de chiffres étiquetées provenant des numéros de maisons de Google Street View, fournissant des images complètes avec des boîtes englobantes autour de chaque chiffre pour les tâches de détection et de reconnaissance d'objets.

SVHN Full est un ensemble de données de référence largement utilisé en vision par ordinateur, dérivé des images de Google Street View représentant des numéros de maisons. Il contient plus de 600 000 images de chiffres étiquetées, chacune présentée comme une scène complète avec un ou plusieurs chiffres, accompagnée d'annotations de boîtes englobantes qui localisent chaque chiffre dans l'image. Cela le distingue de la version plus simple SVHN (recadrée), qui fournit des chiffres uniques déjà centrés. SVHN Full est conçu pour des tâches telles que la détection de chiffres, la reconnaissance et la compréhension de scènes de bout en bout, ce qui en fait un banc d'essai standard pour les modèles d'apprentissage automatique.

L'ensemble de données a été introduit par des chercheurs de l'Université Stanford et de Google en 2011, dans le cadre d'un article intitulé « Reading Digits in Natural Images with Unsupervised Feature Learning ». La motivation principale était de créer une alternative réelle à l'ensemble de données MNIST, qui consiste en chiffres manuscrits. Contrairement à MNIST, les images SVHN présentent des variations naturelles d'éclairage, de perspective et d'arrière-plan encombré, ce qui les rend plus difficiles et plus proches d'applications pratiques comme la lecture automatisée d'adresses ou la reconnaissance de plaques d'immatriculation.

Composition de l'ensemble de données

SVHN Full comprend au total 604 388 images étiquetées. La répartition officielle inclut 73 257 images pour l'entraînement, 26 032 images pour le test et 531 061 images supplémentaires pour les données d'entraînement additionnelles, qui peuvent être utilisées comme complément. Chaque image est une image couleur RVB de 32x32 pixels, bien que les scènes complètes contiennent souvent des chiffres qui n'occupent qu'une petite partie du cadre. Les annotations de boîtes englobantes spécifient les coordonnées de chaque chiffre, ainsi qu'une étiquette de classe de 0 à 9. L'ensemble de données inclut également un ensemble séparé de 10 000 images à des fins de validation, bien que cela soit moins couramment utilisé dans les bancs d'essai standard.

Les chiffres sont extraits de numéros de maisons dans les images Google Street View, ce qui signifie qu'ils apparaissent dans une variété de polices, de couleurs et d'orientations. Certaines images contiennent plusieurs chiffres, et le nombre de chiffres par image peut varier de un à cinq ou plus. Cette variabilité exige que les modèles non seulement classifient les chiffres, mais aussi les localisent avec précision dans la scène.

Tâche et évaluation

La tâche principale associée à SVHN Full est la détection et la reconnaissance d'objets. Un modèle doit prédire, pour chaque image, un ensemble de boîtes englobantes et les classes de chiffres correspondantes. L'évaluation utilise généralement la métrique d'intersection sur union (IoU) pour mesurer la précision de localisation, combinée à la précision de classification. Un protocole courant consiste à exiger une IoU supérieure à 0,5 pour qu'une détection soit considérée comme correcte, puis à calculer la précision et le rappel sur l'ensemble de test.

En pratique, de nombreuses études utilisent SVHN Full comme banc d'essai pour comparer les réseaux de neurones convolutifs (CNN) et les architectures plus récentes comme les transformeurs. L'ensemble de données est souvent utilisé conjointement avec la version recadrée de SVHN, qui isole les chiffres uniques, pour séparer la composante de détection de la classification pure. Les résultats de pointe sur SVHN Full se sont considérablement améliorés depuis sa publication, les modèles modernes d'apprentissage profond atteignant plus de 99 % de précision sur la version recadrée et des taux de détection quasi parfaits sur la version complète.

Relation avec d'autres ensembles de données

SVHN Full fait partie d'une famille d'ensembles de données de reconnaissance de chiffres qui inclut MNIST, USPS et SVHN recadré. Il est souvent utilisé comme alternative plus difficile à MNIST pour évaluer la robustesse des modèles face au bruit et à la distorsion du monde réel. L'ensemble de données a également été intégré dans des bancs d'essai plus vastes comme le défi « Street View House Numbers », hébergé sur Kaggle et ayant attiré des milliers de participants. De plus, SVHN Full a été utilisé dans la recherche sur l'apprentissage non supervisé et semi-supervisé, car l'ensemble d'entraînement supplémentaire fournit une grande quantité de données non étiquetées ou faiblement étiquetées qui peuvent être exploitées.

L'ensemble de données est disponible publiquement en téléchargement sur le site officiel de Stanford et est inclus dans des bibliothèques populaires d'apprentissage automatique comme TensorFlow et PyTorch, ce qui le rend facilement accessible pour l'expérimentation. Son utilisation répandue a contribué au développement de techniques comme l'augmentation de données, la Batch Normalization et les réseaux résiduels, qui sont désormais standard en vision par ordinateur.

Défis et limites

Malgré sa popularité, SVHN Full présente certaines limites. Les images sont de résolution relativement faible (32x32), ce qui peut rendre difficile la distinction entre des chiffres similaires comme 3 et 8, surtout lorsqu'ils sont petits ou partiellement occlus. L'ensemble de données contient également un déséquilibre de classes, le chiffre « 0 » étant plus fréquent que les autres, bien que cela soit moins prononcé que dans certains autres ensembles de données. De plus, comme les images proviennent de Street View, elles peuvent contenir des biais liés à la localisation géographique et aux types de bâtiments, ce qui pourrait affecter la généralisation à d'autres domaines.

Un autre défi est que les annotations de boîtes englobantes ne sont pas toujours serrées, et certaines images contiennent des chiffres partiellement coupés aux bords. Cela peut entraîner des ambiguïtés dans l'évaluation. Les chercheurs ont abordé ces problèmes en proposant des protocoles d'annotation raffinés ou en utilisant l'ensemble de données en combinaison avec des techniques de génération de données synthétiques.

Applications et impact

SVHN Full a joué un rôle déterminant dans l'avancement du domaine de l'apprentissage profond pour la détection d'objets. Il a été utilisé pour entraîner des modèles pour la reconnaissance automatique de plaques d'immatriculation, la lecture de codes postaux et d'autres tâches centrées sur les chiffres. L'ensemble de données sert également de banc d'essai pour évaluer la transférabilité des modèles entraînés sur des données synthétiques, ainsi que pour tester l'efficacité des méthodes d'apprentissage de caractéristiques non supervisées. Sa nature réelle en fait une ressource précieuse pour développer des algorithmes robustes capables de fonctionner dans des environnements non contrôlés.

La publication de SVHN Full a coïncidé avec l'essor de l'apprentissage profond et la disponibilité de GPU puissants, et il a été cité dans des milliers d'articles de recherche. Il reste un choix standard à des fins éducatives, permettant aux étudiants et aux praticiens d'expérimenter avec des techniques de pointe dans un cadre gérable mais réaliste. En 2025, il continue d'être un ensemble de données pertinent, bien que des ensembles plus récents comme les versions augmentées ou les scènes synthétiques soient de plus en plus utilisés pour des tâches plus complexes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·object-detection·digit-recognition
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique