Le jeu de données SVHN (Street View House Numbers) est une collection d'images de chiffres dérivées de numéros de maisons photographiés par les véhicules de Google Street View. Il a été introduit en 2011 par des chercheurs de Google (dont Yuval Netzer, Tao Wang, Adam Coates, Alessandro Bissacco, Bo Wu et Andrew Y. Ng) comme une alternative plus difficile et plus réaliste au jeu de données classique MNIST pour la reconnaissance de chiffres manuscrits. SVHN contient plus de 600 000 images de chiffres étiquetées, chacune étant recadrée à partir d'une photographie plus large prise au niveau de la rue. Le jeu de données est conçu pour tester les algorithmes sur la reconnaissance de chiffres dans des scènes naturelles et encombrées, où les chiffres peuvent être déformés, partiellement occultés ou entourés d'autres textes et objets. Il est devenu une référence standard dans la recherche en apprentissage automatique et en apprentissage profond, utilisé pour des tâches telles que la classification de chiffres, la détection d'objets et la reconnaissance de séquences.
Le jeu de données est divisé en trois parties : un ensemble d'entraînement de 73 257 images, un ensemble de test de 26 032 images et un ensemble supplémentaire de 531 131 images « extra » pouvant être utilisé pour l'entraînement. Chaque image est une image couleur (RGB) de 32x32 pixels, centrée sur un seul chiffre, mais contenant souvent des parties de chiffres adjacents ou d'autres bruits visuels. Les étiquettes sont les valeurs réelles des chiffres (0-9). SVHN est remarquable par son origine réelle : les images proviennent de véritables plaques de numéros de maisons, qui présentent une grande variété de polices, de couleurs, de fonds et de conditions d'éclairage. Cela en fait un banc d'essai plus réaliste que les jeux de données synthétiques, et il a été utilisé pour évaluer la robustesse des architectures de réseaux de neurones, des techniques d'augmentation de données et des approches d'apprentissage par transfert.
Caractéristiques et défis du jeu de données
Contrairement à MNIST, où les chiffres sont écrits proprement et centrés, les images SVHN contiennent un encombrement visuel important. Un seul chiffre peut être partiellement occulté par un panneau, une fenêtre ou un autre chiffre. Les chiffres eux-mêmes peuvent être pivotés, inclinés ou avoir des épaisseurs variables. L'arrière-plan peut inclure des murs de briques, des portes, du feuillage ou d'autres éléments architecturaux. Ces facteurs font de SVHN une tâche de classification plus difficile, avec une performance humaine estimée à environ 98 % de précision, tandis que les modèles de apprentissage profond de pointe ont atteint plus de 99 % de précision sur l'ensemble de test. Le jeu de données comprend également une annotation de « structure de chiffres » pour chaque image, spécifiant les boîtes englobantes de tous les chiffres dans l'image complète d'origine, ce qui permet des tâches comme la localisation de chiffres et la reconnaissance de chiffres multiples.
L'ensemble « extra » est particulièrement utile pour les expériences d'apprentissage semi-supervisé, car il fournit un grand pool de données non étiquetées (ou faiblement étiquetées). De nombreux articles de recherche ont utilisé SVHN pour démontrer l'efficacité de techniques telles que l'augmentation de données (par exemple, recadrage aléatoire, rotation, variation de couleur), la normalisation par lots et les connexions résiduelles. Le jeu de données est également un choix courant pour évaluer les modèles génératifs, tels que les modèles de IA générative, en raison de sa taille d'image relativement petite et de sa complexité modérée.
Applications dans la recherche
SVHN a été largement utilisé dans la recherche académique et industrielle. Il sert de banc d'essai standard pour les algorithmes de classification d'images, souvent associé à MNIST et CIFAR-10 dans des études comparatives. Au début des années 2010, c'était un jeu de données clé pour démontrer la puissance des réseaux de neurones convolutifs profonds (CNN). Par exemple, en 2012, des chercheurs du laboratoire d'IA de Stanford et d'autres institutions ont utilisé SVHN pour montrer que les CNN profonds pouvaient surpasser les méthodes traditionnelles basées sur des caractéristiques artisanales. Le jeu de données a également été utilisé dans des études sur l'adaptation de domaine, où des modèles entraînés sur des données synthétiques (par exemple, MNIST) sont adaptés à des données réelles (par exemple, SVHN).
Au-delà de la classification, SVHN est utilisé pour des tâches de détection d'objets, où l'objectif est de localiser et de reconnaître tous les chiffres dans une image complète de rue. Les images complètes (pas seulement les chiffres recadrés) sont disponibles, et les annotations de boîtes englobantes permettent d'entraîner des modèles de détection. Cela a des applications dans la reconnaissance automatisée d'adresses, pertinente pour les systèmes de navigation et les services de cartographie comme TomTom et Waymo. Le jeu de données a également été utilisé dans la recherche sur la robustesse adversarial, car sa complexité naturelle en fait une cible difficile pour les attaques adversariales.
Comparaison avec d'autres jeux de données
SVHN est souvent comparé à MNIST, qui se compose de 70 000 chiffres manuscrits (28x28 en niveaux de gris). Alors que MNIST est considéré comme « résolu » (avec des modèles atteignant plus de 99,7 % de précision), SVHN reste un banc d'essai plus difficile. Les différences clés sont : (1) les images SVHN sont en couleur et plus grandes (32x32), (2) elles contiennent un encombrement d'arrière-plan, (3) les chiffres peuvent être déformés et partiellement occultés, et (4) la distribution des étiquettes est plus équilibrée (MNIST a un léger déséquilibre). SVHN est également similaire au jeu de données CIFAR-10, mais CIFAR-10 contient des objets généraux (avions, voitures, animaux) plutôt que des chiffres. Pour les chercheurs intéressés par la reconnaissance de chiffres dans des scénarios réels, SVHN est la norme de facto.
Le jeu de données a également été utilisé dans le développement de systèmes d'intelligence artificielle pour le traitement automatisé de documents, comme la lecture de numéros de maisons à partir d'images au niveau de la rue. Des entreprises comme Google DeepMind et OpenAI ont utilisé SVHN dans leurs recherches, bien qu'il soit plus couramment associé à des laboratoires académiques. Le jeu de données est librement disponible en téléchargement, et sa popularité a conduit à son inclusion dans de nombreuses bibliothèques et tutoriels d'apprentissage automatique.
Orientations futures et limites
Bien que SVHN soit une ressource précieuse, il a des limites. Les images sont en relativement basse résolution (32x32), ce qui peut ne pas capturer les détails fins. Le jeu de données est également limité aux chiffres, il ne couvre donc pas les lettres ou d'autres caractères. Les chercheurs ont créé des extensions, comme le jeu de données « SVHN full », qui inclut les images complètes d'origine sans recadrage. À partir du milieu des années 2020, SVHN est encore largement utilisé, mais des jeux de données plus récents comme « Street View Text » de Google ou divers jeux de données de texte de scène ont émergé pour des tâches plus complexes. Néanmoins, SVHN reste un point d'entrée standard pour les étudiants et les chercheurs qui apprennent la vision par ordinateur et le apprentissage profond. Sa simplicité, combinée à la complexité du monde réel, en fait un jeu de données idéal pour prototyper de nouveaux algorithmes et à des fins éducatives.