História
O Desafio ImageNet, oficialmente conhecido como Desafio de Reconhecimento Visual em Larga Escala da ImageNet (ILSVRC), é uma competição anual de software onde programas competem para classificar e detectar corretamente objetos e cenas em imagens. Lançado em 2010, ele utiliza uma lista reduzida de mil classes não sobrepostas do banco de dados ImageNet, que contém mais de 14 milhões de imagens anotadas manualmente em mais de 20 mil categorias. O desafio tornou-se um marco fundamental na visão computacional, impulsionando a revolução do aprendizado profundo após 2012.
História
A pesquisadora de IA Fei-Fei Li começou a desenvolver o conceito da ImageNet em 2006, com o objetivo de expandir os dados disponíveis para treinar algoritmos de IA, numa época em que a maioria das pesquisas se concentrava em modelos. Em 2007, Li conheceu a professora de Princeton Christiane Fellbaum, criadora do WordNet, e construiu a ImageNet a partir de cerca de 22 mil substantivos do WordNet. Ela foi inspirada por uma estimativa de 1987 de que uma pessoa média reconhece cerca de 30 mil tipos de objetos.
Como professora assistente em Princeton, Li montou uma equipe que utilizou o Amazon Mechanical Turk para a classificação de imagens. A rotulagem ocorreu de julho de 2008 a abril de 2010, envolvendo 49 mil trabalhadores de 167 países que filtraram e rotularam mais de 160 milhões de imagens candidatas. Cada uma das 14 milhões de imagens foi rotulada três vezes. O plano original previa 10 mil imagens por categoria em 40 mil categorias, mas isso não foi totalmente alcançado.
O banco de dados foi apresentado pela primeira vez como pôster na Conferência sobre Visão Computacional e Reconhecimento de Padrões (CVPR) em 2009, com o título "ImageNet: Uma Prévia de um Conjunto de Dados Hierárquico em Larga Escala". Em 2009, Alex Berg sugeriu adicionar a localização de objetos como tarefa, o que levou a uma colaboração com o concurso PASCAL Visual Object Classes. O primeiro Desafio ImageNet em 2010 contou com 1.000 classes e localização de objetos, em comparação com as 20 classes e 19.737 imagens do PASCAL VOC.
Significância para o Aprendizado Profundo
Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcançou uma taxa de erro top-5 de 15,3% no Desafio ImageNet de 2012, mais de 10,8 pontos percentuais abaixo do segundo colocado. Esse sucesso foi possibilitado pelo treinamento em unidades de processamento gráfico (GPUs), um componente essencial da revolução do aprendizado profundo. Segundo a revista The Economist, "de repente, as pessoas começaram a prestar atenção, não apenas na comunidade de IA, mas em toda a indústria de tecnologia".
Em 2015, a AlexNet foi superada pela CNN muito profunda da Microsoft, com mais de 100 camadas, que venceu o Desafio ImageNet de 2015 com uma taxa de erro de 3,57% no conjunto de teste. Andrej Karpathy estimou em 2014 que, com esforço concentrado, um humano poderia alcançar uma taxa de erro de 5,1%, e com esforço máximo, 2,4%.
Conjunto de Dados
A ImageNet terceiriza seu processo de anotação. As anotações em nível de imagem indicam a presença ou ausência de uma classe de objeto, enquanto as anotações em nível de objeto fornecem caixas delimitadoras. O conjunto de dados usa uma variante do esquema do WordNet, ampliado com 120 categorias de raças de cães para classificação de granulação fina.
Em 30 de abril de 2010, a ImageNet tinha 21.841 sinônimos não vazios, 14.197.122 imagens, 1.034.908 imagens com anotações de caixas delimitadoras e 1,2 milhão de imagens com características SIFT. Em 2012, a ImageNet era o maior usuário acadêmico do Mechanical Turk, com trabalhadores identificando uma média de 50 imagens por minuto.
Categorias
As categorias são filtradas a partir de conceitos do WordNet, cada uma chamada de "synset" (conjunto de sinônimos). A ImageNet inclui 21.841 synsets que são substantivos contáveis visualmente ilustráveis. Cada synset tem um ID do WordNet (wnid) começando com "n" (por exemplo, "n02084071" para "cachorro"). As categorias se enquadram em 9 níveis, do nível 1 (por exemplo, "mamífero") ao nível 9 (por exemplo, "pastor alemão").
Formato das Imagens
As imagens foram coletadas de mecanismos de busca online (Google, Picsearch, Yahoo, Flickr) usando sinônimos em vários idiomas. Elas estão em formato RGB com resoluções variadas; por exemplo, na ImageNet de 2012, a categoria "peixe" varia de 4288 x 2848 a 75 x 56 pixels. Em aprendizado de máquina, as imagens são tipicamente pré-processadas para uma resolução padrão e normalizadas. Por exemplo, no PyTorch, os valores dos pixels são divididos por 255 para ficarem entre 0 e 1, e depois normalizados subtraindo a média (0,485, 0,456, 0,406) e dividindo pelo desvio padrão (0,229, 0,224, 0,225) de cada canal.
Rótulos e Anotações
Cada imagem é rotulada com exatamente um wnid. Características SIFT densas (descritores brutos, palavras-código quantizadas e coordenadas) estavam disponíveis para a ImageNet-1K, projetada para o modelo de saco de palavras visuais. Caixas delimitadoras estavam disponíveis para cerca de 3.000 synsets populares, com uma média de 150 imagens cada. Algumas imagens também possuem anotações de atributos, embora os detalhes sejam limitados.
Legado
O Desafio ImageNet tem sido fundamental para o avanço das técnicas de aprendizado-de-maquina e aprendizado-profundo. Ele popularizou o uso de arquiteturas de rede-neural como a rede-residual e métodos de treinamento como normalizacao-por-lote e aumento-de-dados. O sucesso da competição despertou interesse em inteligencia-artificial e influenciou desenvolvimentos subsequentes em ia-generativa e na pesquisa de modelo-de-linguagem-grande, embora o desafio em si tenha se concentrado em tarefas visuais.