SVHN Cropped é um conjunto de dados de referência amplamente utilizado em aprendizado de máquina e aprendizado profundo, consistindo em mais de 600.000 imagens de dígitos recortadas, derivadas de números de casas em imagens do Google Street View. Cada imagem é um patch colorido de 32x32 pixels centrado em um único dígito (0-9), tornando o conjunto adequado para tarefas como classificação de dígitos, treinamento de redes neurais e pesquisa em aumento de dados. O conjunto foi introduzido por pesquisadores do Stanford AI Lab e do Google em 2011 como parte do projeto Street View House Numbers (SVHN), que visava melhorar a leitura automatizada de números de casas para serviços de mapeamento.
O conjunto SVHN Cropped é frequentemente comparado ao MNIST, mas é considerado mais desafiador devido às suas características de imagem natural: os dígitos aparecem com fundos variados, condições de iluminação, distorções e, ocasionalmente, dígitos perturbadores nas bordas. O conjunto completo é dividido em 73.257 imagens de treinamento, 26.032 imagens de teste e 531.131 amostras de treinamento extras adicionais, que podem ser usadas para aumentar o conjunto de treinamento. Os rótulos correspondem ao dígito central, e as imagens são fornecidas em formato PNG juntamente com metadados de caixas delimitadoras dos dígitos.
Estrutura e Formato do Conjunto de Dados
O conjunto de dados SVHN Cropped é organizado em três arquivos principais: train.tar.gz, test.tar.gz e extra.tar.gz. Cada arquivo contém imagens PNG individuais nomeadas por um identificador único e um arquivo digitStruct.mat (em formato MATLAB) que armazena as coordenadas das caixas delimitadoras e os rótulos de cada dígito. Para a versão recortada, as imagens já estão centralizadas no dígito alvo, mas os metadados ainda incluem as caixas delimitadoras originais, o que pode ser útil para tarefas como localização de objetos ou para criar variantes do conjunto.
Cada imagem tem 32x32 pixels com três canais de cor (RGB), o que contrasta com as imagens MNIST em tons de cinza de 28x28. O tamanho maior e a informação de cor fornecem maior complexidade visual, tornando o SVHN Cropped uma escolha preferida para testar arquiteturas convolucionais e designs de redes residuais. O conjunto está disponível publicamente para fins de pesquisa e pode ser baixado do site oficial do SVHN ou por meio de bibliotecas populares de aprendizado de máquina, como TensorFlow e PyTorch, que incluem carregadores integrados.
Aplicações em Aprendizado de Máquina
O SVHN Cropped é usado principalmente para tarefas de classificação de dígitos, servindo como um padrão de referência para avaliar novos modelos e técnicas. Tem sido empregado em numerosos estudos para comparar o desempenho de várias arquiteturas, incluindo redes neurais convolucionais (CNNs), ResNets e modelos de visão baseados em transformadores mais recentes. A variabilidade natural das imagens do conjunto o torna um bom substituto para tarefas reais de OCR (reconhecimento óptico de caracteres), como leitura de números de casas, placas de veículos ou qualquer sequência de dígitos em fotografias.
Além da classificação, o SVHN Cropped tem sido usado em experimentos de aprendizado curricular, onde os modelos são treinados primeiro com amostras mais fáceis, e para testar estratégias de aumento de dados como recorte aleatório, rotação e variação de cor. Também serve como um ambiente de teste para normalização em lote, Dropout e outras técnicas de regularização, bem como para estudos de poda de modelos e destilação de conhecimento. O conjunto extra de 531.131 imagens é frequentemente usado para simular cenários de aprendizado semissupervisionado, onde apenas um subconjunto rotulado pequeno é usado juntamente com o pool maior não rotulado.
Comparação com Outros Conjuntos de Dados
O SVHN Cropped é frequentemente comparado com MNIST e CIFAR-10. Ao contrário do MNIST, que contém dígitos limpos, centralizados e em tons de cinza, os dígitos do SVHN Cropped são coloridos, têm escalas e orientações variadas e incluem ruído de fundo. Isso torna o SVHN Cropped mais representativo das condições do mundo real e mais difícil para os modelos alcançarem alta precisão. Por exemplo, uma CNN simples pode alcançar mais de 99% de precisão no MNIST, mas apenas cerca de 95-97% no SVHN Cropped sem ajuste extensivo ou aumento de dados.
Comparado ao CIFAR-10, que contém 60.000 imagens coloridas de 32x32 em 10 classes de objetos, o SVHN Cropped oferece mais dados de treinamento (mais de 600.000 imagens) e uma tarefa mais focada (reconhecimento de dígitos). O tamanho maior do conjunto é benéfico para treinar redes mais profundas sem overfitting. Pesquisadores frequentemente usam o SVHN Cropped como um meio-termo entre a simplicidade do MNIST e a complexidade do ImageNet, fornecendo uma avaliação rápida, porém significativa, do desempenho do modelo.
Impacto e Legado
A introdução do SVHN Cropped contribuiu para o avanço do aprendizado profundo ao fornecer um conjunto de dados desafiador, porém acessível, para a comunidade de pesquisa. Ele foi citado em milhares de artigos e permanece um componente padrão em muitos cursos e tutoriais de aprendizado de máquina. O conjunto também destacou o valor de usar dados do mundo real de serviços como o Google Street View, demonstrando como a coleta de dados em larga escala pode impulsionar o progresso em inteligência artificial.
Ao longo dos anos, o SVHN Cropped foi integrado a várias suítes de benchmark e rankings, como os do Papers with Code, onde continua a ser usado para acompanhar o desempenho de última geração. Sua influência se estende ao desenvolvimento de técnicas de aumento de dados e à avaliação de robustez a mudanças de domínio. No início da década de 2020, o SVHN Cropped permanece um recurso relevante e amplamente utilizado, embora conjuntos de dados mais novos com tarefas mais complexas tenham surgido, ele ainda serve como um degrau fundamental para pesquisadores e profissionais.