El conjunto de datos SVHN (Street View House Numbers) es una colección de imágenes de dígitos derivadas de números de casas fotografiados por los vehículos de Google Street View. Fue introducido en 2011 por investigadores de Google (incluyendo a Yuval Netzer, Tao Wang, Adam Coates, Alessandro Bissacco, Bo Wu y Andrew Y. Ng) como una alternativa más desafiante y realista al clásico conjunto de datos MNIST para el reconocimiento de dígitos escritos a mano. SVHN contiene más de 600,000 imágenes de dígitos etiquetadas, cada una recortada de una fotografía más grande a nivel de calle. El conjunto de datos está diseñado para probar algoritmos en el reconocimiento de dígitos en escenas naturales y desordenadas, donde los dígitos pueden estar distorsionados, parcialmente ocluidos o rodeados de otro texto y objetos. Se ha convertido en un estándar de referencia en la investigación de Machine learning y Deep learning, utilizado para tareas como la clasificación de dígitos, la detección de objetos y el reconocimiento de secuencias.
El conjunto de datos se divide en tres partes: un conjunto de entrenamiento de 73,257 imágenes, un conjunto de prueba de 26,032 imágenes y un conjunto adicional de 531,131 imágenes "extra" que se pueden usar para el entrenamiento. Cada imagen es una imagen a color (RGB) de 32x32 píxeles, centrada en un solo dígito, pero que a menudo contiene partes de dígitos adyacentes u otro ruido visual. Las etiquetas son los valores reales de los dígitos (0-9). SVHN es notable por su origen en el mundo real: las imágenes provienen de placas de números de casas reales, que exhiben una amplia variedad de fuentes, colores, fondos y condiciones de iluminación. Esto lo convierte en un banco de pruebas más realista que los conjuntos de datos sintéticos, y se ha utilizado para evaluar la robustez de las arquitecturas de Neural network, las técnicas de aumento de datos y los enfoques de aprendizaje por transferencia.
Características y desafíos del conjunto de datos
A diferencia de MNIST, donde los dígitos están escritos de manera limpia y centrada, las imágenes de SVHN contienen un desorden visual significativo. Un solo dígito puede estar parcialmente ocluido por un poste de señalización, una ventana u otro dígito. Los dígitos en sí pueden estar rotados, sesgados o tener grosores variables. El fondo puede incluir paredes de ladrillo, puertas, follaje u otros elementos arquitectónicos. Estos factores hacen de SVHN una tarea de clasificación más difícil, con un rendimiento a nivel humano estimado en alrededor del 98% de precisión, mientras que los modelos de Deep learning de última generación han logrado más del 99% de precisión en el conjunto de prueba. El conjunto de datos también incluye una anotación de "estructura de dígitos" para cada imagen, que especifica los cuadros delimitadores de todos los dígitos en la imagen completa original, lo que permite tareas como la localización de dígitos y el reconocimiento de múltiples dígitos.
El conjunto "extra" es particularmente útil para experimentos de aprendizaje semisupervisado, ya que proporciona un gran grupo de datos no etiquetados (o débilmente etiquetados). Muchos artículos de investigación han utilizado SVHN para demostrar la efectividad de técnicas como el aumento de datos (por ejemplo, recorte aleatorio, rotación, variación de color), la normalización por lotes y las conexiones residuales. El conjunto de datos también es una opción común para evaluar modelos generativos, como los modelos de Generative AI, debido a su tamaño de imagen relativamente pequeño y su complejidad moderada.
Aplicaciones en la investigación
SVHN se ha utilizado ampliamente en la investigación académica e industrial. Sirve como un banco de pruebas estándar para algoritmos de clasificación de imágenes, a menudo emparejado con MNIST y CIFAR-10 en estudios comparativos. A principios de la década de 2010, fue un conjunto de datos clave para demostrar el poder de las redes neuronales convolucionales profundas (CNN). Por ejemplo, en 2012, investigadores de Stanford AI Lab y otras instituciones utilizaron SVHN para mostrar que las CNN profundas podían superar a los métodos tradicionales de características diseñadas a mano. El conjunto de datos también se ha utilizado en estudios sobre adaptación de dominio, donde los modelos entrenados con datos sintéticos (por ejemplo, MNIST) se adaptan a datos del mundo real (por ejemplo, SVHN).
Más allá de la clasificación, SVHN se utiliza para tareas de detección de objetos, donde el objetivo es localizar y reconocer todos los dígitos en una imagen completa de vista de calle. Las imágenes completas (no solo los dígitos recortados) están disponibles, y las anotaciones de cuadros delimitadores permiten entrenar modelos de detección. Esto tiene aplicaciones en el reconocimiento automatizado de direcciones, que es relevante para los sistemas de navegación y los servicios de mapeo como TomTom y Waymo. El conjunto de datos también se ha utilizado en investigaciones sobre robustez adversarial, ya que su complejidad natural lo convierte en un objetivo desafiante para ataques adversariales.
Comparación con otros conjuntos de datos
SVHN se compara a menudo con MNIST, que consiste en 70,000 dígitos escritos a mano (28x28 en escala de grises). Mientras que MNIST se considera "resuelto" (con modelos que logran más del 99.7% de precisión), SVHN sigue siendo un punto de referencia más desafiante. Las diferencias clave son: (1) las imágenes de SVHN son a color y más grandes (32x32), (2) contienen desorden de fondo, (3) los dígitos pueden estar distorsionados y parcialmente ocluidos, y (4) la distribución de etiquetas es más equilibrada (MNIST tiene un ligero desequilibrio). SVHN también es similar al conjunto de datos CIFAR-10, pero CIFAR-10 contiene objetos generales (aviones, automóviles, animales) en lugar de dígitos. Para los investigadores interesados en el reconocimiento de dígitos en escenarios del mundo real, SVHN es el estándar de facto.
El conjunto de datos también se ha utilizado en el desarrollo de sistemas de Artificial intelligence para el procesamiento automatizado de documentos, como la lectura de números de casas a partir de imágenes a nivel de calle. Empresas como Google DeepMind y OpenAI han utilizado SVHN en su investigación, aunque se asocia más comúnmente con laboratorios académicos. El conjunto de datos está disponible gratuitamente para su descarga, y su popularidad ha llevado a su inclusión en muchas bibliotecas y tutoriales de aprendizaje automático.
Direcciones futuras y limitaciones
Aunque SVHN es un recurso valioso, tiene limitaciones. Las imágenes son de resolución relativamente baja (32x32), lo que puede no capturar detalles finos. El conjunto de datos también se limita a dígitos, por lo que no cubre letras u otros caracteres. Los investigadores han creado extensiones, como el conjunto de datos "SVHN completo", que incluye las imágenes completas originales sin recortar. A mediados de la década de 2020, SVHN todavía se usa ampliamente, pero han surgido conjuntos de datos más nuevos, como "Street View Text" de Google o varios conjuntos de datos de texto en escenas, para tareas más complejas. No obstante, SVHN sigue siendo un punto de entrada estándar para estudiantes e investigadores que aprenden sobre Computer vision y Deep learning. Su simplicidad, combinada con la complejidad del mundo real, lo convierte en un conjunto de datos ideal para prototipar nuevos algoritmos y para fines educativos.