Traduzido do inglês

SVHN Full é um conjunto de dados com 604.388 imagens de dígitos rotuladas, provenientes dos números de casas do Google Street View, fornecendo imagens completas com caixas delimitadoras ao redor de cada dígito para tarefas de detecção e reconhecimento de objetos.

SVHN Full é um conjunto de dados de referência amplamente utilizado em visão computacional, derivado de imagens do Google Street View de números de casas. Ele contém mais de 600.000 imagens de dígitos rotuladas, cada uma apresentada como uma cena completa com um ou mais dígitos, juntamente com anotações de caixas delimitadoras que localizam cada dígito dentro da imagem. Isso o distingue do conjunto de dados SVHN (recortado), mais simples, que fornece dígitos únicos já centralizados. O SVHN Full é projetado para tarefas como detecção de dígitos, reconhecimento e compreensão de cena de ponta a ponta, tornando-o um ambiente de teste padrão para modelos de aprendizado de máquina.

O conjunto de dados foi introduzido por pesquisadores da Universidade de Stanford e do Google em 2011, como parte de um artigo intitulado "Reading Digits in Natural Images with Unsupervised Feature Learning". A motivação principal foi criar uma alternativa do mundo real ao conjunto de dados MNIST, que consiste em dígitos manuscritos. Ao contrário do MNIST, as imagens do SVHN contêm variações naturais de iluminação, perspectiva e desordem de fundo, tornando-as mais desafiadoras e mais próximas de aplicações práticas, como leitura automatizada de endereços ou reconhecimento de placas de veículos.

Composição do Conjunto de Dados

O SVHN Full compreende 604.388 imagens rotuladas no total. A divisão oficial inclui 73.257 imagens para treinamento, 26.032 imagens para teste e 531.061 imagens adicionais para dados extras de treinamento, que podem ser usados como suplemento. Cada imagem é uma imagem colorida RGB de 32x32 pixels, embora as cenas completas frequentemente contenham dígitos que ocupam apenas uma pequena porção do quadro. As anotações de caixas delimitadoras especificam as coordenadas de cada dígito, juntamente com um rótulo de classe de 0 a 9. O conjunto de dados também inclui um conjunto separado de 10.000 imagens para fins de validação, embora isso seja menos comumente usado em referências padrão.

Os dígitos são extraídos de números de casas em imagens do Google Street View, o que significa que aparecem em uma variedade de fontes, cores e orientações. Algumas imagens contêm múltiplos dígitos, e o número de dígitos por imagem pode variar de um a cinco ou mais. Essa variabilidade exige que os modelos não apenas classifiquem dígitos, mas também os localizem com precisão dentro da cena.

Tarefa e Avaliação

A tarefa principal associada ao SVHN Full é detecção e reconhecimento de objetos. Um modelo deve prever, para cada imagem, um conjunto de caixas delimitadoras e classes de dígitos correspondentes. A avaliação normalmente usa a métrica de interseção sobre união (IoU) para medir a precisão da localização, combinada com a precisão da classificação. Um protocolo comum é exigir uma IoU maior que 0,5 para que uma detecção seja considerada correta e, em seguida, calcular precisão e recall no conjunto de teste.

Na prática, muitos estudos usam o SVHN Full como referência para comparar redes neurais convolucionais (CNNs) e arquiteturas mais recentes, como transformadores. O conjunto de dados é frequentemente usado em conjunto com a versão recortada do SVHN, que isola dígitos únicos, para separar o componente de detecção da classificação pura. Os resultados de última geração no SVHN Full melhoraram significativamente desde seu lançamento, com modelos modernos de aprendizado profundo alcançando mais de 99% de precisão na versão recortada e taxas de detecção quase perfeitas na versão completa.

Relação com Outros Conjuntos de Dados

O SVHN Full faz parte de uma família de conjuntos de dados de reconhecimento de dígitos que inclui MNIST, USPS e o SVHN recortado. Ele é frequentemente usado como uma alternativa mais desafiadora ao MNIST para avaliar a robustez dos modelos a ruído e distorção do mundo real. O conjunto de dados também foi incorporado a referências maiores, como o desafio "Street View House Numbers", que foi hospedado no Kaggle e atraiu milhares de participantes. Além disso, o SVHN Full tem sido usado em pesquisas sobre aprendizado não supervisionado e semissupervisionado, pois o conjunto de treinamento extra fornece uma grande quantidade de dados não rotulados ou fracamente rotulados que podem ser aproveitados.

O conjunto de dados está disponível publicamente para download no site oficial de Stanford e está incluído em bibliotecas populares de aprendizado de máquina, como TensorFlow e PyTorch, tornando-o facilmente acessível para experimentação. Seu uso generalizado contribuiu para o desenvolvimento de técnicas como aumento de dados, Batch Normalization e redes residuais, que agora são padrão em visão computacional.

Desafios e Limitações

Apesar de sua popularidade, o SVHN Full tem certas limitações. As imagens são de resolução relativamente baixa (32x32), o que pode dificultar a distinção entre dígitos semelhantes, como 3 e 8, especialmente quando são pequenos ou parcialmente ocluídos. O conjunto de dados também contém um desequilíbrio de classes, com o dígito '0' sendo mais frequente que outros, embora isso seja menos pronunciado do que em alguns outros conjuntos de dados. Além disso, como as imagens são derivadas do Street View, elas podem conter vieses relacionados à localização geográfica e aos tipos de edifícios, o que pode afetar a generalização para outros domínios.

Outro desafio é que as anotações de caixas delimitadoras nem sempre são precisas, e algumas imagens contêm dígitos parcialmente cortados nas bordas. Isso pode levar a ambiguidades na avaliação. Pesquisadores abordaram esses problemas propondo protocolos de anotação refinados ou usando o conjunto de dados em combinação com técnicas de geração de dados sintéticos.

Aplicações e Impacto

O SVHN Full tem sido fundamental para o avanço do campo do aprendizado profundo para detecção de objetos. Ele tem sido usado para treinar modelos para reconhecimento automático de placas de veículos, leitura de códigos postais e outras tarefas centradas em dígitos. O conjunto de dados também serve como referência para avaliar a transferibilidade de modelos treinados em dados sintéticos, bem como para testar a eficácia de métodos de aprendizado de características não supervisionado. Sua natureza do mundo real o torna um recurso valioso para o desenvolvimento de algoritmos robustos que podem operar em ambientes não controlados.

O lançamento do SVHN Full coincidiu com o surgimento do aprendizado profundo e a disponibilidade de GPUs poderosas, e ele foi citado em milhares de artigos de pesquisa. Ele continua sendo uma escolha padrão para fins educacionais, permitindo que estudantes e profissionais experimentem técnicas de última geração em um ambiente gerenciável, porém realista. Em 2025, ele continua sendo um conjunto de dados relevante, embora conjuntos de dados mais novos, como versões aumentadas ou cenas sintéticas, sejam cada vez mais usados para tarefas mais complexas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·object-detection·digit-recognition
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico