Traduzido do inglês

ImageNet-Sketch é um conjunto de dados de 50.000 imagens de esboços em preto e branco distribuídas em 1.000 classes do ImageNet, projetado para avaliar a robustez de modelos sob mudança de domínio, de fotos naturais para desenhos de linha abstratos.

ImageNet-Sketch é um conjunto de dados de referência introduzido em 2019 para testar o quão bem modelos de classificação de imagens generalizam para um domínio visual diferente. Ele contém 50.000 imagens de esboços em escala de cinza, com 50 imagens para cada uma das 1.000 classes do conjunto de dados ImageNet original. Os esboços são coletados de pesquisas do Google Imagens para termos como "esboço de [nome da classe]" e são filtrados manualmente para garantir que representem o objeto pretendido. Diferentemente de fotografias naturais, essas imagens são desenhos de linhas abstratos, frequentemente com detalhes mínimos, tornando-os um teste desafiador de mudança de domínio para modelos treinados em conjuntos de dados de fotos padrão.

O conjunto de dados foi criado por pesquisadores da Universidade da Califórnia, Berkeley, incluindo Haohan Wang, Songwei Ge, Zachary Lipton e Eric Xing. Ele foi lançado juntamente com um artigo intitulado "Learning Robust Global Representations by Penalizing Local Predictive Power", apresentado na Conferência de 2019 sobre Sistemas de Processamento de Informação Neural (NeurIPS). A motivação principal foi fornecer uma sonda simples, porém eficaz, para avaliar a robustez de um modelo a mudanças de distribuição, particularmente a mudança de imagens do mundo real para esboços humanos abstratos. Desde então, o ImageNet-Sketch tornou-se um conjunto de avaliação padrão no campo de aprendizado de máquina e aprendizado profundo, frequentemente usado juntamente com outros benchmarks de robustez, como ImageNet-C e ImageNet-R.

Construção e Características

O processo de construção envolveu consultar a pesquisa do Google Imagens com o padrão "esboço de [classe]" para cada uma das 1.000 classes do ImageNet. As imagens retornadas foram então filtradas para remover imagens que não eram esboços, como fotos ou diagramas, e para garantir que cada classe tivesse pelo menos 50 esboços válidos. O conjunto de dados final contém exatamente 50 imagens por classe, totalizando 50.000 imagens. Todas as imagens são redimensionadas para uma resolução consistente, tipicamente 224x224 pixels, para corresponder aos tamanhos de entrada padrão para classificadores de rede neural.

Uma característica chave do ImageNet-Sketch é sua dependência de esboços desenhados por humanos, que são inerentemente mais abstratos e menos fotorrealistas do que imagens naturais. Esses esboços frequentemente omitem cor, textura e detalhes finos, forçando os modelos a depender de pistas globais de forma e estrutura. Isso torna o conjunto de dados particularmente útil para estudar se os modelos aprenderam características robustas e generalizáveis ou se sobreajustaram a estatísticas superficiais em imagens naturais.

Papel na Avaliação de Robustez

O ImageNet-Sketch é amplamente usado para medir a robustez de classificadores de imagens sob mudança de domínio. Modelos treinados no ImageNet tipicamente mostram uma queda significativa na precisão quando avaliados no ImageNet-Sketch, frequentemente de cerca de 70-80% de precisão top-1 em imagens naturais para 20-30% em esboços. Essa lacuna de desempenho destaca a fragilidade de muitos modelos de aprendizado profundo quando confrontados com entradas fora da distribuição.

O conjunto de dados é frequentemente incluído em rankings de robustez e estudos. Por exemplo, é um componente central dos benchmarks de corrupção ImageNet-C e ImageNet-P, embora seja distinto por representar uma mudança de domínio natural, criada por humanos, em vez de corrupções sintéticas. Pesquisadores usaram o ImageNet-Sketch para avaliar a eficácia de várias técnicas de robustez, como estratégias de aumento de dados, treinamento adversarial e mudanças arquiteturais como variantes de rede residual. Também foi usado para sondar as representações internas dos modelos, revelando que muitos modelos dependem fortemente de textura e padrões locais em vez de forma global, que os esboços perturbam.

Relação com Outros Benchmarks

O ImageNet-Sketch complementa outros conjuntos de dados de mudança de domínio, como ImageNet-R (que contém representações artísticas, como pinturas e desenhos animados) e ImageNet-A (que contém exemplos adversariais que ocorrem naturalmente). Enquanto o ImageNet-R inclui uma mistura de estilos artísticos, o ImageNet-Sketch foca especificamente em desenhos de linhas, fornecendo um teste mais limpo de reconhecimento baseado em forma. O conjunto de dados também está relacionado ao conjunto de dados Sketchy e ao conjunto de dados de esboços TU-Berlin, mas é único em sua escala e alinhamento direto com as classes do ImageNet.

No contexto mais amplo da pesquisa em inteligência artificial, o ImageNet-Sketch tem sido instrumental em destacar as limitações dos modelos atuais e impulsionar o interesse em aprendizado robusto e generalizável. É frequentemente citado em artigos sobre generalização de domínio, aprendizado autossupervisionado e interpretabilidade de modelos. Em 2025, permanece uma ferramenta de avaliação padrão em visão computacional, com muitos modelos de última geração relatando seu desempenho neste benchmark.

Limitações e Críticas

Uma limitação do ImageNet-Sketch é que os esboços são coletados de pesquisas na web, o que pode introduzir vieses em estilo ou conteúdo. Por exemplo, algumas classes podem ter estilos de esboço mais diversos do que outras, e o processo de filtragem pode inadvertidamente incluir imagens que não são esboços puros. Além disso, o conjunto de dados é estático, então não captura estilos de esboço em evolução ao longo do tempo. Apesar dessas questões, sua simplicidade e facilidade de uso o tornaram uma escolha popular para pesquisadores.

Outra crítica é que a queda de desempenho no ImageNet-Sketch pode não refletir totalmente mudanças de domínio do mundo real, pois esboços são uma abstração extrema. No entanto, essa extremidade é precisamente o que torna o conjunto de dados valioso para testar a resistência dos modelos. Isso força os pesquisadores a desenvolver métodos que vão além de memorizar padrões de pixels e, em vez disso, aprendem representações mais abstratas e transferíveis.

Uso em Pesquisa e Indústria

Na pesquisa acadêmica, o ImageNet-Sketch é frequentemente usado para avaliar novas arquiteturas e métodos de treinamento. Por exemplo, estudos sobre transformers de visão e redes convolucionais frequentemente relatam resultados neste conjunto de dados para demonstrar robustez. Também é usado no desenvolvimento de modelos de fundação, onde o pré-treinamento em dados diversos é esperado para melhorar o desempenho em tais conjuntos fora da distribuição. Na indústria, empresas que trabalham com sistemas de reconhecimento de imagens, como aqueles em direção autônoma ou imagem médica, podem usar o ImageNet-Sketch como uma verificação de sanidade para a generalização do modelo, embora seja mais comum em ambientes de pesquisa.

O conjunto de dados está disponível publicamente para download, e seu uso é regido pelos termos originais do ImageNet, que permitem uso de pesquisa não comercial. Foi citado em milhares de artigos, tornando-o um dos benchmarks de robustez mais influentes no campo. Em 2025, continua sendo um recurso relevante e amplamente usado, especialmente à medida que a comunidade foca em construir modelos que sejam confiáveis em ambientes diversos e imprevisíveis.

Direções Futuras

Olhando para o futuro, pesquisadores estão explorando maneiras de estender o ImageNet-Sketch para outros domínios, como esboços 3D ou desenhos animados, e criar versões mais desafiadoras com classes de granularidade mais fina. Há também interesse em usar o conjunto de dados para treinar modelos que sejam inerentemente mais robustos, em vez de apenas avaliá-los. Por exemplo, alguns trabalhos exploraram incorporar dados de esboço em conjuntos de treinamento para melhorar o viés de forma, o que poderia levar a melhor generalização em outras mudanças de domínio. O conjunto de dados permanece uma pedra angular no esforço contínuo para alcançar sistemas verdadeiramente robustos de inteligência artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·robustness·domain-shift
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico