O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) foi uma competição anual de software realizada de 2010 a 2017 como parte do projeto ImageNet. Ele desafiava algoritmos a classificar e detectar corretamente objetos e cenas dentro de um conjunto selecionado de 1.000 classes de objetos não sobrepostas. O desafio é amplamente creditado por catalisar a revolução do aprendizado profundo na visão computacional, especialmente após 2012, quando uma rede neural convolucional alcançou uma melhoria dramática em precisão.
A competição surgiu do projeto ImageNet, um grande banco de dados visual projetado para pesquisa em reconhecimento visual de objetos. Iniciado pela pesquisadora de IA Fei-Fei Li, o ImageNet contém mais de 14 milhões de imagens anotadas manualmente abrangendo mais de 20.000 categorias, com pelo menos um milhão de imagens também fornecendo anotações de caixa delimitadora. O ILSVRC usou um subconjunto dessas imagens e categorias para fornecer um benchmark padronizado para avaliar e comparar algoritmos de visão computacional.
História
Fei-Fei Li começou a conceituar o ImageNet em 2006, com o objetivo de expandir os dados disponíveis para treinar algoritmos de IA em uma época em que a maioria das pesquisas se concentrava em modelos e algoritmos. Em 2007, ela conheceu a professora de Princeton Christiane Fellbaum, uma das criadoras do WordNet, o que levou à construção do ImageNet com base nos cerca de 22.000 substantivos do WordNet. Li também foi inspirada por uma estimativa de 1987 de que a pessoa média reconhece cerca de 30.000 tipos diferentes de objetos.
Como professora assistente em Princeton, Li montou uma equipe e usou o Amazon Mechanical Turk para classificação de imagens. A rotulagem ocorreu de julho de 2008 a abril de 2010, envolvendo 49.000 trabalhadores de 167 países que filtraram e rotularam mais de 160 milhões de imagens candidatas. Cada uma das 14 milhões de imagens foi rotulada três vezes. O plano original previa 10.000 imagens por categoria em 40.000 categorias, mas isso se mostrou impraticável; humanos podem classificar no máximo 2 imagens por segundo, exigindo um esforço estimado de 19 anos-homem de trabalho.
O banco de dados foi apresentado pela primeira vez como um pôster na Conferência sobre Visão Computacional e Reconhecimento de Padrões (CVPR) de 2009, na Flórida, intitulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". Em 2009, Alex Berg sugeriu adicionar a localização de objetos como uma tarefa, levando à colaboração com o concurso PASCAL Visual Object Classes. O primeiro ILSVRC foi realizado em 2010, apresentando 1.000 classes e localização de objetos, em comparação com as 20 classes e 19.737 imagens do PASCAL VOC.
Significância para o Aprendizado Profundo
Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcançou um erro top-5 de 15,3% no Desafio ImageNet 2012, mais de 10,8 pontos percentuais abaixo do segundo colocado. Esse sucesso foi viabilizado pelo uso de unidades de processamento gráfico (GPUs) durante o treinamento, um ingrediente essencial da revolução do aprendizado profundo. Segundo The Economist, "De repente, as pessoas começaram a prestar atenção, não apenas dentro da comunidade de IA, mas em toda a indústria de tecnologia como um todo."
Em 2015, a AlexNet foi superada pela CNN muito profunda da Microsoft, com mais de 100 camadas, que venceu o concurso ImageNet 2015 com um erro de 3,57% no conjunto de teste. Andrej Karpathy estimou em 2014 que, com esforço concentrado, ele poderia alcançar uma taxa de erro de 5,1%, e cerca de 10 pessoas de seu laboratório alcançaram aproximadamente 12-13% com menos esforço. Estimou-se que, com esforço máximo, um humano poderia alcançar um erro de 2,4%.
O impacto do desafio se estendeu além da visão computacional, estimulando inovações em arquiteturas de redes neurais, técnicas de treinamento e aceleração de hardware. Também influenciou o desenvolvimento de frameworks de aprendizado de máquina e o campo mais amplo da inteligência artificial.
Conjunto de Dados
O ImageNet terceiriza seu processo de anotação. Anotações em nível de imagem indicam a presença ou ausência de uma classe de objeto em uma imagem, enquanto anotações em nível de objeto fornecem uma caixa delimitadora ao redor da parte visível do objeto. O ImageNet usa uma variante do esquema do WordNet para categorizar objetos, aumentada com 120 categorias de raças de cães para classificação de granulação fina.
Em 2012, o ImageNet era o maior usuário acadêmico do Mechanical Turk no mundo, com o trabalhador médio identificando 50 imagens por minuto. O plano original para o ImageNet completo teria cerca de 50 milhões de imagens limpas, diversas e em resolução total distribuídas por aproximadamente 50.000 synsets, mas isso não foi alcançado.
Em 30 de abril de 2010, as estatísticas resumidas eram:
- Número total de synsets não vazios: 21.841
- Número total de imagens: 14.197.122
- Número de imagens com anotações de caixa delimitadora: 1.034.908
- Número de synsets com características SIFT: 1.000
- Número de imagens com características SIFT: 1,2 milhão
Categorias
As categorias do ImageNet foram filtradas a partir de conceitos do WordNet. Cada conceito, que pode conter múltiplos sinônimos (por exemplo, "kitty" e "young cat"), é chamado de "conjunto de sinônimos" ou "synset". O WordNet 3.0 contém mais de 100.000 synsets, principalmente substantivos (mais de 80.000). O ImageNet filtrou esses para 21.841 synsets que são substantivos contáveis que podem ser ilustrados visualmente.
Cada synset no WordNet 3.0 tem um "WordNet ID" (wnid), uma concatenação de parte do discurso e um deslocamento. Todo wnid começa com "n" porque o ImageNet inclui apenas substantivos. Por exemplo, o wnid do synset "dog, domestic dog, Canis familiaris" é "n02084071". As categorias caem em 9 níveis, do nível 1 (como "mamífero") ao nível 9 (como "pastor alemão").
Formato de Imagem
As imagens foram extraídas de mecanismos de busca de imagens online (Google, Picsearch, MSN, Yahoo, Flickr, etc.) usando sinônimos em vários idiomas. Por exemplo, para pastor alemão, eles usaram termos como "German police dog", "Alsatian", "ovejero alemán", "pastore tedesco" e "德国牧羊犬".
O ImageNet consiste em imagens no formato RGB com resoluções variadas. Por exemplo, na categoria "peixe" do ImageNet 2012, as resoluções variam de 4288 x 2848 a 75 x 56. Em aprendizado de máquina, essas são tipicamente pré-processadas em uma resolução constante padrão e branqueadas antes de processamento adicional por redes neurais. Por exemplo, no PyTorch, as imagens do ImageNet são normalizadas dividindo os valores de pixel para ficarem entre 0 e 1, depois subtraindo [0,485, 0,456, 0,406] e dividindo por [0,229, 0,224, 0,225], que são as médias e desvios padrão do ImageNet.
Rótulos e Anotações
Cada imagem é rotulada com exatamente um wnid. Características SIFT densas (descritores SIFT brutos, palavras-código quantizadas e coordenadas) para o ImageNet-1K estavam disponíveis para download, projetadas para o saco de palavras visuais. Caixas delimitadoras de objetos estavam disponíveis para cerca de 3.000 synsets populares, com uma média de 150 imagens por synset. Além disso, algumas imagens têm anotações de atributos, embora o desafio se concentrasse principalmente em tarefas de classificação e localização.
O ILSVRC foi concluído em 2017, mas seu legado persiste na forma do conjunto de dados ImageNet, que permanece um benchmark padrão para avaliar modelos de visão computacional. A ênfase da competição em dados em larga escala do mundo real e avaliação rigorosa ajudou a impulsionar o progresso rápido no campo, influenciando desenvolvimentos subsequentes em IA generativa e outras áreas do aprendizado de máquina.