Traducido del inglés

SVHN Cropped es un conjunto de datos de referencia que contiene más de 600,000 imágenes recortadas de dígitos provenientes de Google Street View, ampliamente utilizado para entrenar y evaluar modelos de aprendizaje profundo en el reconocimiento de dígitos y la visión por computadora.

SVHN Cropped es un conjunto de datos de referencia ampliamente utilizado en aprendizaje automático y aprendizaje profundo, que consta de más de 600,000 imágenes recortadas de dígitos derivadas de números de casas en imágenes de Google Street View. Cada imagen es un parche de color de 32x32 píxeles centrado en un solo dígito (0-9), lo que hace que el conjunto sea adecuado para tareas como clasificación de dígitos, entrenamiento de redes neuronales e investigación de aumento de datos. El conjunto fue introducido por investigadores de Stanford AI Lab y Google en 2011 como parte del proyecto Street View House Numbers (SVHN), cuyo objetivo era mejorar la lectura automatizada de números de casas para servicios de cartografía.

El conjunto SVHN Cropped se compara a menudo con MNIST, pero se considera más desafiante debido a sus características de imagen natural: los dígitos aparecen con fondos variables, condiciones de iluminación, distorsiones y, ocasionalmente, dígitos distractores en los bordes. El conjunto completo se divide en 73,257 imágenes de entrenamiento, 26,032 imágenes de prueba y 531,131 muestras de entrenamiento adicionales, que pueden usarse para aumentar el conjunto de entrenamiento. Las etiquetas corresponden al dígito central, y las imágenes se proporcionan en formato PNG junto con metadatos de cuadros delimitadores de dígitos.

Estructura y formato del conjunto de datos

El conjunto de datos SVHN Cropped está organizado en tres archivos principales: train.tar.gz, test.tar.gz y extra.tar.gz. Cada archivo contiene imágenes PNG individuales nombradas por un identificador único, y un archivo digitStruct.mat (en formato MATLAB) que almacena las coordenadas de los cuadros delimitadores y las etiquetas para cada dígito. Para la versión recortada, las imágenes ya están centradas en el dígito objetivo, pero los metadatos aún incluyen los cuadros delimitadores originales, lo que puede ser útil para tareas como localización de objetos o para crear variantes del conjunto.

Cada imagen es de 32x32 píxeles con tres canales de color (RGB), lo que contrasta con las imágenes en escala de grises de 28x28 de MNIST. El tamaño más grande y la información de color proporcionan una mayor complejidad visual, lo que hace que SVHN Cropped sea una opción preferida para probar arquitecturas convolucionales y diseños de redes residuales. El conjunto está disponible públicamente para fines de investigación y puede descargarse desde el sitio web oficial de SVHN o a través de bibliotecas populares de aprendizaje automático como TensorFlow y PyTorch, que incluyen cargadores integrados.

Aplicaciones en aprendizaje automático

SVHN Cropped se utiliza principalmente para tareas de clasificación de dígitos, sirviendo como un estándar de referencia para evaluar nuevos modelos y técnicas. Se ha empleado en numerosos estudios para comparar el rendimiento de diversas arquitecturas, incluidas redes neuronales convolucionales (CNN), ResNets y modelos de visión basados en transformadores más recientes. La variabilidad natural de las imágenes del conjunto lo convierte en un buen proxy para tareas de OCR (reconocimiento óptico de caracteres) del mundo real, como leer números de casas, placas de matrícula o cualquier secuencia de dígitos en fotografías.

Más allá de la clasificación, SVHN Cropped se ha utilizado para experimentos de aprendizaje curricular, donde los modelos se entrenan primero con muestras más fáciles, y para probar estrategias de aumento de datos como recorte aleatorio, rotación y variación de color. También sirve como banco de pruebas para normalización por lotes, abandono y otras técnicas de regularización, así como para estudios de poda de modelos y destilación de conocimiento. El conjunto adicional de 531,131 imágenes se usa a menudo para simular escenarios de aprendizaje semisupervisado, donde solo se utiliza un pequeño subconjunto etiquetado junto con un grupo más grande no etiquetado.

Comparación con otros conjuntos de datos

SVHN Cropped se compara frecuentemente con MNIST y CIFAR-10. A diferencia de MNIST, que contiene dígitos limpios, centrados y en escala de grises, los dígitos de SVHN Cropped son en color, tienen escalas y orientaciones variables e incluyen desorden de fondo. Esto hace que SVHN Cropped sea más representativo de condiciones del mundo real y más difícil para que los modelos logren alta precisión. Por ejemplo, una CNN simple podría lograr más del 99% de precisión en MNIST, pero solo alrededor del 95-97% en SVHN Cropped sin un ajuste extenso o aumento de datos.

En comparación con CIFAR-10, que contiene 60,000 imágenes en color de 32x32 en 10 clases de objetos, SVHN Cropped ofrece más datos de entrenamiento (más de 600,000 imágenes) y una tarea más enfocada (reconocimiento de dígitos). El tamaño más grande del conjunto es beneficioso para entrenar redes más profundas sin sobreajuste. Los investigadores suelen usar SVHN Cropped como un punto intermedio entre la simplicidad de MNIST y la complejidad de ImageNet, proporcionando una evaluación rápida pero significativa del rendimiento del modelo.

Impacto y legado

La introducción de SVHN Cropped contribuyó al avance del aprendizaje profundo al proporcionar un conjunto de datos desafiante pero accesible para la comunidad investigadora. Ha sido citado en miles de artículos y sigue siendo un componente estándar en muchos cursos y tutoriales de aprendizaje automático. El conjunto también destacó el valor de usar datos del mundo real de servicios como Google Street View, demostrando cómo la recopilación de datos a gran escala puede impulsar el progreso en inteligencia artificial.

A lo largo de los años, SVHN Cropped se ha integrado en varios conjuntos de referencia y tablas de clasificación, como las de Papers with Code, donde continúa usándose para rastrear el rendimiento de última generación. Su influencia se extiende al desarrollo de técnicas de aumento de datos y a la evaluación de robustez ante cambios de dominio. A principios de la década de 2020, SVHN Cropped sigue siendo un recurso relevante y ampliamente utilizado, aunque han surgido conjuntos de datos más nuevos con tareas más complejas, sigue sirviendo como un peldaño fundamental para investigadores y profesionales por igual.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·deep-learning·benchmark
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial