SUN397 é um conjunto de dados em larga escala para reconhecimento de cenas, introduzido em 2010 por pesquisadores do Laboratório de Ciência da Computação e Inteligência Artificial do MIT e da Universidade de Princeton. Ele contém 108.754 imagens distribuídas em 397 categorias distintas de cenas, tornando-o um dos recursos mais abrangentes para avaliar algoritmos que classificam imagens pelo tipo de ambiente que retratam, como um quarto, uma estação de esqui ou uma biblioteca. O conjunto foi projetado para ampliar os limites da compreensão de cenas além de tarefas centradas em objetos, enfatizando o contexto holístico de uma imagem.
O conjunto de dados é organizado hierarquicamente, com categorias agrupadas em classes mais amplas, como interno, externo natural e externo feito pelo homem. Cada categoria contém pelo menos 100 imagens, garantindo amostras suficientes para treinamento e teste. As imagens são provenientes de coleções públicas, incluindo Flickr e outros repositórios online, e são curadas manualmente para garantir relevância e qualidade. O SUN397 é comumente usado em conjunto com o benchmark SUN, que também inclui atributos e anotações de objetos para um subconjunto de imagens.
Construção e Anotação
A criação do SUN397 envolveu um processo rigoroso para garantir diversidade e cobertura. Os pesquisadores primeiro compilaram uma lista de categorias de cenas de várias fontes, incluindo dicionários e conjuntos de dados existentes, e depois a expandiram para 397 categorias. As imagens foram coletadas por meio de buscas na web e submissões de usuários, e depois filtradas para remover duplicatas e conteúdo irrelevante. Cada imagem foi verificada manualmente para pertencer à sua categoria atribuída. O conjunto foi dividido em conjuntos de treinamento e teste, com um protocolo padrão de usar 50 imagens por categoria para treinamento e 50 para teste, embora outras divisões também sejam usadas.
Papel na Pesquisa de Reconhecimento de Cenas
O SUN397 tornou-se um benchmark padrão em visão computacional e aprendizado de máquina. Ele é frequentemente usado para avaliar redes neurais convolucionais e outros modelos de aprendizado profundo. O conjunto desafia algoritmos a distinguir entre cenas visualmente semelhantes, como diferentes tipos de cozinhas ou bibliotecas, e a generalizar em diversas condições de iluminação, perspectivas e oclusões. Muitos modelos de última geração relatam desempenho no SUN397 como uma métrica-chave, frequentemente alcançando mais de 90% de precisão no conjunto de teste.
Comparação com Outros Conjuntos de Dados
O SUN397 complementa outros conjuntos de dados populares como Places365 e ImageNet. Enquanto o ImageNet foca na classificação de objetos, o SUN397 enfatiza a compreensão em nível de cena. O Places365, introduzido posteriormente, é um conjunto de dados de cenas maior, com 365 categorias, mas o SUN397 permanece valioso devido às suas categorias mais refinadas e ao seu papel na pesquisa inicial de reconhecimento de cenas. O conjunto também inclui um subconjunto com rótulos de atributos, permitindo tarefas como previsão de atributos de cena.
Impacto e Legado
A introdução do SUN397 impulsionou avanços significativos no reconhecimento de cenas, contribuindo para o desenvolvimento de modelos que entendem contexto e layout. Ele tem sido usado em aplicações que vão desde direção autônoma até recuperação de imagens baseada em conteúdo. O conjunto está disponível publicamente para fins de pesquisa e é amplamente citado na literatura acadêmica. Sua estrutura hierárquica e protocolos de avaliação claros o tornaram um recurso durável, ainda referenciado em estudos contemporâneos em 2025.