ImageNet (conjunto de dados)

Traduzido do inglês

ImageNet é um grande banco de dados visual hierárquico com mais de 14 milhões de imagens anotadas manualmente, utilizado para pesquisa em reconhecimento visual de objetos, mais conhecido pelo desafio anual ImageNet Large Scale Visual Recognition Challenge (ILSVRC).

ImageNet é um banco de dados visual em larga escala projetado para uso em pesquisas de software de reconhecimento de objetos visuais. O projeto fornece mais de 14 milhões de imagens anotadas manualmente indicando os objetos retratados, com pelo menos um milhão de imagens também contendo caixas delimitadoras. Ele abrange mais de 20.000 categorias, cada uma normalmente contendo várias centenas de imagens. O banco de dados de anotações para URLs de imagens de terceiros está disponível gratuitamente, embora as imagens reais não pertençam ao ImageNet. Desde 2010, o projeto realiza um concurso anual de software, o ImageNet Large Scale Visual Recognition Challenge (ILSVRC), onde programas competem para classificar e detectar objetos e cenas usando uma lista reduzida de mil classes não sobrepostas.

História

A pesquisadora de IA Fei-Fei Li começou a desenvolver a ideia do ImageNet em 2006. Numa época em que a maior parte da pesquisa em IA focava em modelos e algoritmos, Li pretendia expandir e melhorar os dados disponíveis para treinar algoritmos de IA. Em 2007, Li reuniu-se com a professora de Princeton Christiane Fellbaum, uma das criadoras do WordNet, para discutir o projeto. Este encontro levou Li a construir o ImageNet a partir dos aproximadamente 22.000 substantivos do WordNet e a adotar muitas de suas características. Ela também foi inspirada por uma estimativa de 1987 de que a pessoa média reconhece cerca de 30.000 tipos diferentes de objetos.

Como professora assistente em Princeton, Li reuniu uma equipe de pesquisadores para trabalhar no projeto. Eles usaram o Amazon Mechanical Turk para ajudar a classificar imagens. A rotulagem começou em julho de 2008 e terminou em abril de 2010, envolvendo 49.000 trabalhadores de 167 países que filtraram e rotularam mais de 160 milhões de imagens candidatas. O orçamento permitiu que cada uma das 14 milhões de imagens fosse rotulada três vezes. O plano original previa 10.000 imagens por categoria em 40.000 categorias, totalizando 400 milhões de imagens, cada uma verificada três vezes. No entanto, humanos podem classificar no máximo 2 imagens por segundo, e nesse ritmo estimou-se que seriam necessários 19 anos-homem de trabalho sem descanso.

O banco de dados foi apresentado pela primeira vez como um pôster na Conferência sobre Visão Computacional e Reconhecimento de Padrões (CVPR) de 2009, na Flórida, intitulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". Em 2009, Alex Berg sugeriu adicionar a localização de objetos como uma tarefa. Li abordou o concurso PASCAL Visual Object Classes em 2009 para colaboração, o que resultou no ImageNet Large Scale Visual Recognition Challenge começando em 2010, com 1.000 classes e localização de objetos, em comparação com as 20 classes e 19.737 imagens do PASCAL VOC.

Importância para o Aprendizado Profundo

Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcançou um erro top-5 de 15,3% no ImageNet 2012 Challenge, mais de 10,8 pontos percentuais abaixo do segundo colocado. O uso de unidades de processamento gráfico (GPUs) durante o treinamento tornou viáveis as redes neurais convolucionais, um ingrediente essencial da revolução do aprendizado profundo. Segundo The Economist, "De repente, as pessoas começaram a prestar atenção, não apenas na comunidade de IA, mas em toda a indústria de tecnologia."

Em 2015, a AlexNet foi superada pela CNN muito profunda da Microsoft, com mais de 100 camadas, que venceu o concurso ImageNet 2015 com uma taxa de erro de 3,57% no conjunto de teste. Andrej Karpathy estimou em 2014 que, com esforço concentrado, ele poderia alcançar uma taxa de erro de 5,1%, e cerca de 10 pessoas de seu laboratório alcançaram aproximadamente 12-13% com menos esforço. Estimou-se que, com esforço máximo, um humano poderia alcançar 2,4%.

Conjunto de Dados

O ImageNet terceiriza seu processo de anotação. As anotações em nível de imagem indicam a presença ou ausência de uma classe de objeto em uma imagem, como "há tigres nesta imagem" ou "não há tigres nesta imagem". As anotações em nível de objeto fornecem uma caixa delimitadora ao redor da parte visível do objeto indicado. O ImageNet usa uma variante do esquema amplo do WordNet para categorizar objetos, aumentada com 120 categorias de raças de cães para demonstrar classificação de granulação fina.

Em 2012, o ImageNet era o maior usuário acadêmico do Mechanical Turk no mundo, com o trabalhador médio identificando 50 imagens por minuto. O plano original para o ImageNet completo teria cerca de 50 milhões de imagens limpas, diversas e de resolução total distribuídas em aproximadamente 50.000 synsets, mas isso não foi alcançado. As estatísticas resumidas em 30 de abril de 2010 incluíam 21.841 synsets não vazios, 14.197.122 imagens no total, 1.034.908 imagens com anotações de caixa delimitadora, 1.000 synsets com recursos SIFT e 1,2 milhões de imagens com recursos SIFT.

Categorias

As categorias do ImageNet foram filtradas a partir dos conceitos do WordNet. Cada conceito, como pode conter múltiplos sinônimos (por exemplo, "kitty" e "young cat"), é chamado de "conjunto de sinônimos" ou "synset". O WordNet 3.0 tem mais de 100.000 synsets, a maioria dos quais são substantivos (mais de 80.000). O ImageNet filtrou estes para 21.841 synsets que são substantivos contáveis e podem ser ilustrados visualmente. Cada synset no WordNet 3.0 tem um "WordNet ID" (wnid), uma concatenação da classe gramatical e um deslocamento. Todo wnid começa com "n" porque o ImageNet só inclui substantivos; por exemplo, o wnid para "cão, cão doméstico, Canis familiaris" é "n02084071". As categorias caem em 9 níveis, do nível 1 (como "mamífero") ao nível 9 (como "pastor alemão").

Formato de Imagem

As imagens foram extraídas de mecanismos de busca de imagens online (Google, Picsearch, MSN, Yahoo, Flickr, etc.) usando sinônimos em múltiplos idiomas, como "German shepherd", "German police dog", "Alsatian", "ovejero alemán" e "pastore tedesco". O ImageNet consiste em imagens em formato RGB com resoluções variadas; por exemplo, na categoria "peixe" do ImageNet 2012, as resoluções variam de 4288 x 2848 a 75 x 56. Em aprendizado de máquina, estas são tipicamente pré-processadas para uma resolução constante padrão e branqueadas antes de processamento adicional por redes neurais. Por exemplo, no PyTorch, as imagens do ImageNet são normalizadas dividindo os valores de pixel para cair entre 0 e 1, depois subtraindo [0,485, 0,456, 0,406], e dividindo por [0,229, 0,224, 0,225], que são as médias e desvios padrão para o ImageNet.

Rótulos e Anotações

Cada imagem é rotulada com exatamente um wnid. Recursos SIFT densos (descritores SIFT brutos, palavras-código quantizadas e coordenadas) para o ImageNet-1K estavam disponíveis para download, projetados para modelos de saco de palavras visuais. Caixas delimitadoras estavam disponíveis para cerca de 3.000 synsets populares, com uma média de 150 imagens por synset. Além disso, algumas imagens têm anotações de atributos, e o conjunto de dados tem sido amplamente usado em pesquisas de aprendizado de máquina, particularmente para treinar e avaliar modelos de inteligência artificial.

Legado e Impacto

O ImageNet teve um impacto profundo no campo da visão computacional e da inteligência artificial. Ele forneceu um benchmark padronizado que acelerou o progresso no reconhecimento e classificação de objetos. O sucesso da AlexNet em 2012 desencadeou a revolução do aprendizado profundo, levando à adoção generalizada de técnicas de aprendizado profundo em vários domínios. A estrutura hierárquica e a escala do ImageNet também influenciaram o desenvolvimento de outros conjuntos de dados e o design de modelos baseados em transformadores, que mais tarde se tornaram fundamentais em IA generativa e modelos de linguagem de grande escala. O conjunto de dados continua sendo um recurso crítico para treinar e avaliar sistemas de reconhecimento visual, e seu legado continua a moldar a pesquisa e as aplicações de IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·deep-learning·image-recognition
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico