Traduzido do inglês

SUN397 é um conjunto de dados de referência para reconhecimento de cenas, contendo 108.754 imagens em 397 categorias de cenas, amplamente utilizado para avaliar algoritmos de [[computer-vision|visão computacional]].

SUN397 é um conjunto de dados em larga escala para reconhecimento de cenas, introduzido em 2010 por pesquisadores do Laboratório de Ciência da Computação e Inteligência Artificial do MIT e da Universidade de Princeton. Ele contém 108.754 imagens distribuídas em 397 categorias distintas de cenas, tornando-o um dos recursos mais abrangentes para avaliar algoritmos que classificam imagens pelo tipo de ambiente que retratam, como um quarto, uma estação de esqui ou uma biblioteca. O conjunto foi projetado para ampliar os limites da compreensão de cenas além de tarefas centradas em objetos, enfatizando o contexto holístico de uma imagem.

O conjunto de dados é organizado hierarquicamente, com categorias agrupadas em classes mais amplas, como interno, externo natural e externo feito pelo homem. Cada categoria contém pelo menos 100 imagens, garantindo amostras suficientes para treinamento e teste. As imagens são provenientes de coleções públicas, incluindo Flickr e outros repositórios online, e são curadas manualmente para garantir relevância e qualidade. O SUN397 é comumente usado em conjunto com o benchmark SUN, que também inclui atributos e anotações de objetos para um subconjunto de imagens.

Construção e Anotação

A criação do SUN397 envolveu um processo rigoroso para garantir diversidade e cobertura. Os pesquisadores primeiro compilaram uma lista de categorias de cenas de várias fontes, incluindo dicionários e conjuntos de dados existentes, e depois a expandiram para 397 categorias. As imagens foram coletadas por meio de buscas na web e submissões de usuários, e depois filtradas para remover duplicatas e conteúdo irrelevante. Cada imagem foi verificada manualmente para pertencer à sua categoria atribuída. O conjunto foi dividido em conjuntos de treinamento e teste, com um protocolo padrão de usar 50 imagens por categoria para treinamento e 50 para teste, embora outras divisões também sejam usadas.

Papel na Pesquisa de Reconhecimento de Cenas

O SUN397 tornou-se um benchmark padrão em visão computacional e aprendizado de máquina. Ele é frequentemente usado para avaliar redes neurais convolucionais e outros modelos de aprendizado profundo. O conjunto desafia algoritmos a distinguir entre cenas visualmente semelhantes, como diferentes tipos de cozinhas ou bibliotecas, e a generalizar em diversas condições de iluminação, perspectivas e oclusões. Muitos modelos de última geração relatam desempenho no SUN397 como uma métrica-chave, frequentemente alcançando mais de 90% de precisão no conjunto de teste.

Comparação com Outros Conjuntos de Dados

O SUN397 complementa outros conjuntos de dados populares como Places365 e ImageNet. Enquanto o ImageNet foca na classificação de objetos, o SUN397 enfatiza a compreensão em nível de cena. O Places365, introduzido posteriormente, é um conjunto de dados de cenas maior, com 365 categorias, mas o SUN397 permanece valioso devido às suas categorias mais refinadas e ao seu papel na pesquisa inicial de reconhecimento de cenas. O conjunto também inclui um subconjunto com rótulos de atributos, permitindo tarefas como previsão de atributos de cena.

Impacto e Legado

A introdução do SUN397 impulsionou avanços significativos no reconhecimento de cenas, contribuindo para o desenvolvimento de modelos que entendem contexto e layout. Ele tem sido usado em aplicações que vão desde direção autônoma até recuperação de imagens baseada em conteúdo. O conjunto está disponível publicamente para fins de pesquisa e é amplamente citado na literatura acadêmica. Sua estrutura hierárquica e protocolos de avaliação claros o tornaram um recurso durável, ainda referenciado em estudos contemporâneos em 2025.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·scene-recognition·benchmark
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico