Conjunto de Dados ImageNet Criado

Traduzido do inglês

ImageNet é um banco de dados visual em larga escala criado por Fei-Fei Li e colegas, contendo mais de 14 milhões de imagens anotadas manualmente em mais de 20.000 categorias, e tem sido fundamental para o avanço do aprendizado profundo por meio de seu desafio anual de reconhecimento.

ImageNet é um banco de dados visual em larga escala projetado para uso em pesquisas de software de reconhecimento de objetos visuais. Ele contém mais de 14 milhões de imagens anotadas manualmente, indicando quais objetos estão retratados, com pelo menos um milhão de imagens também fornecendo caixas delimitadoras. O banco de dados abrange mais de 20.000 categorias, cada uma normalmente consistindo em várias centenas de imagens. Desde 2010, o projeto ImageNet realiza um concurso anual de software, o ImageNet Large Scale Visual Recognition Challenge (ILSVRC), onde programas de software competem para classificar e detectar corretamente objetos e cenas. O desafio usa uma lista reduzida de mil classes não sobrepostas.

O projeto foi concebido pela pesquisadora de IA Fei-Fei Li, que começou a trabalhar na ideia em 2006. Numa época em que a maior parte da pesquisa em IA se concentrava em modelos e algoritmos, Li pretendia expandir e melhorar os dados disponíveis para treinar algoritmos de IA. Em 2007, ela se encontrou com a professora de Princeton Christiane Fellbaum, uma das criadoras do WordNet, para discutir o projeto. Isso levou à construção do ImageNet a partir dos cerca de 22.000 substantivos do WordNet e usando muitos de seus recursos. Li também foi inspirada por uma estimativa de 1987 de que a pessoa média reconhece cerca de 30.000 tipos diferentes de objetos.

História e Construção

Como professora assistente em Princeton, Li reuniu uma equipe de pesquisadores para trabalhar no projeto ImageNet. Eles usaram o Amazon Mechanical Turk para ajudar na classificação das imagens. A rotulagem começou em julho de 2008 e terminou em abril de 2010. Foram necessários 49.000 trabalhadores de 167 países para filtrar e rotular mais de 160 milhões de imagens candidatas. O orçamento permitiu que cada uma das 14 milhões de imagens fosse rotulada três vezes.

O plano original previa 10.000 imagens por categoria, para 40.000 categorias em 400 milhões de imagens, cada uma verificada três vezes. No entanto, os humanos podem classificar no máximo duas imagens por segundo, e nesse ritmo estimou-se que seriam necessários 19 anos-homem de trabalho (sem descanso). A equipe apresentou o banco de dados pela primeira vez como um pôster na Conferência de Visão Computacional e Reconhecimento de Padrões (CVPR) de 2009, na Flórida, intitulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". O pôster foi reutilizado na Vision Sciences Society 2009.

Em 2009, Alex Berg sugeriu adicionar a localização de objetos como uma tarefa. Li abordou o concurso PASCAL Visual Object Classes em 2009 para uma colaboração, o que resultou no subsequente ImageNet Large Scale Visual Recognition Challenge a partir de 2010. O desafio apresentava 1000 classes e localização de objetos, em comparação com o PASCAL VOC, que tinha apenas 20 classes e 19.737 imagens em 2010.

Significância para o Aprendizado Profundo

Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcançou um erro top-5 de 15,3% no ImageNet 2012 Challenge, mais de 10,8 pontos percentuais abaixo do segundo colocado. O uso de CNNs foi viável devido ao uso de unidades de processamento gráfico (GPUs) durante o treinamento, um ingrediente essencial da revolução do aprendizado profundo. De acordo com The Economist, "De repente, as pessoas começaram a prestar atenção, não apenas dentro da comunidade de IA, mas em toda a indústria de tecnologia".

Em 2015, a AlexNet foi superada pela CNN muito profunda da Microsoft, com mais de 100 camadas, que venceu o concurso ImageNet 2015 com um erro de 3,57% no conjunto de teste. Andrej Karpathy estimou em 2014 que, com esforço concentrado, ele poderia alcançar uma taxa de erro de 5,1%, e cerca de 10 pessoas de seu laboratório alcançaram aproximadamente 12-13% com menos esforço. Estimou-se que, com esforço máximo, um humano poderia alcançar um erro de 2,4%.

Estrutura do Conjunto de Dados

O ImageNet faz crowdsourcing do seu processo de anotação. Anotações em nível de imagem indicam a presença ou ausência de uma classe de objeto em uma imagem, como "há tigres nesta imagem" ou "não há tigres nesta imagem". Anotações em nível de objeto fornecem uma caixa delimitadora ao redor da parte visível do objeto indicado. O ImageNet usa uma variante do amplo esquema do WordNet para categorizar objetos, aumentado com 120 categorias de raças de cães para mostrar classificação de granulação fina.

Em 2012, o ImageNet era o maior usuário acadêmico do Mechanical Turk no mundo, com o trabalhador médio identificando 50 imagens por minuto. O plano original para o ImageNet completo teria cerca de 50 milhões de imagens limpas, diversas e em resolução total, distribuídas em aproximadamente 50.000 synsets, mas isso não foi alcançado.

Em 30 de abril de 2010, as estatísticas resumidas eram: número total de synsets não vazios: 21.841; número total de imagens: 14.197.122; número de imagens com anotações de caixa delimitadora: 1.034.908; número de synsets com características SIFT: 1.000; número de imagens com características SIFT: 1,2 milhão.

Categorias

As categorias do ImageNet foram filtradas a partir dos conceitos do WordNet. Cada conceito, como pode conter múltiplos sinônimos (por exemplo, "gatinho" e "gato jovem"), é chamado de "conjunto de sinônimos" ou "synset". Havia mais de 100.000 synsets no WordNet 3.0, a maioria sendo substantivos (mais de 80.000). O conjunto de dados ImageNet filtrou esses para 21.841 synsets que são substantivos contáveis que podem ser ilustrados visualmente.

Cada synset no WordNet 3.0 tem um "WordNet ID" (wnid), que é uma concatenação da parte do discurso e um "offset" (um número de identificação único). Todo wnid começa com "n" porque o ImageNet só inclui substantivos. Por exemplo, o wnid do synset "cão, cão doméstico, Canis familiaris" é "n02084071". As categorias caem em 9 níveis, do nível 1 (como "mamífero") ao nível 9 (como "pastor alemão").

Formato da Imagem

As imagens foram extraídas de mecanismos de busca de imagens online (Google, Picsearch, MSN, Yahoo, Flickr, etc.) usando sinônimos em vários idiomas. Por exemplo, para pastor alemão: cão policial alemão, alsaciano, ovejero alemán, pastore tedesco, 德国牧羊犬. O ImageNet consiste em imagens no formato RGB com resoluções variadas. Por exemplo, na categoria "peixe" do ImageNet 2012, a resolução varia de 4288 x 2848 a 75 x 56. Em aprendizado de máquina, essas são tipicamente pré-processadas em uma resolução constante padrão e embranquecidas antes de processamento adicional por redes neurais.

Por exemplo, no PyTorch, as imagens do ImageNet são por padrão normalizadas dividindo os valores de pixel para ficarem entre 0 e 1, depois subtraindo [0,485, 0,456, 0,406] e dividindo por [0,229, 0,224, 0,225]. Essas são as médias e desvios padrão do ImageNet, então isso embranquece os dados de entrada.

Rótulos e Anotações

Cada imagem é rotulada com exatamente um wnid. Características SIFT densas (descritores SIFT brutos, palavras-código quantizadas e coordenadas de cada descritor/palavra-código) para ImageNet-1K estavam disponíveis para download, projetadas para saco de palavras visuais. Caixas delimitadoras de objetos estavam disponíveis para cerca de 3.000 synsets populares com uma média de 150 imagens em cada synset. Além disso, algumas imagens têm anotações de atributos, embora os detalhes sejam limitados.

Legado e Impacto

O ImageNet se tornou um benchmark para pesquisa em aprendizado de máquina e visão computacional, impulsionando o progresso em inteligência artificial. Seu desafio anual estimulou inovações em redes neurais convolucionais e outras arquiteturas, influenciando o campo mais amplo do aprendizado profundo. A escala e a estrutura do conjunto de dados também informaram projetos subsequentes de dados em larga escala e o desenvolvimento de técnicas de aumento de dados.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·deep-learning·image-recognition
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico