Traduzido do inglês

O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2010 foi a primeira competição anual em que programas de software competiram para classificar e detectar objetos no banco de dados ImageNet, utilizando 1.000 classes não sobrepostas e localização de objetos.

O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2010 foi a edição inaugural de um concurso anual de software organizado pelo projeto ImageNet, um grande banco de dados visuais projetado para pesquisas de reconhecimento de objetos visuais. O desafio exigia que os programas participantes classificassem e detectassem corretamente objetos e cenas dentro de uma lista reduzida de mil classes não sobrepostas, um aumento significativo em relação a referências anteriores, como o concurso PASCAL Visual Object Classes (VOC), que usava apenas 20 classes e 19.737 imagens em 2010. O desafio de 2010 marcou um ponto de virada na visão computacional ao fornecer uma plataforma de avaliação padronizada e em larga escala que, mais tarde, catalisaria a revolução do aprendizado profundo.

Origens e Desenvolvimento

O projeto ImageNet foi concebido pela pesquisadora de IA Fei-Fei Li em 2006, em uma época em que a maior parte da pesquisa em IA se concentrava em modelos e algoritmos, e não em dados. Li pretendia expandir e melhorar os dados disponíveis para treinar algoritmos de IA. Em 2007, ela se reuniu com a professora de Princeton, Christiane Fellbaum, uma criadora do WordNet, o que levou à construção do ImageNet a partir dos aproximadamente 22.000 substantivos do WordNet. Li também foi inspirada por uma estimativa de 1987 de que a pessoa comum reconhece cerca de 30.000 tipos diferentes de objetos.

Como professora assistente em Princeton, Li montou uma equipe de pesquisadores e usou o Amazon Mechanical Turk para a classificação de imagens. A rotulagem começou em julho de 2008 e terminou em abril de 2010, envolvendo 49.000 trabalhadores de 167 países que filtraram e rotularam mais de 160 milhões de imagens candidatas. O plano original previa 10.000 imagens por categoria em 40.000 categorias, totalizando 400 milhões de imagens, mas isso foi reduzido devido a restrições práticas. O banco de dados foi apresentado pela primeira vez como um pôster na Conferência de Visão Computacional e Reconhecimento de Padrões (CVPR) de 2009, na Flórida, intitulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset."

Em 2009, Alex Berg sugeriu adicionar a localização de objetos como tarefa, e Li abordou o concurso PASCAL VOC para colaboração. Isso resultou no início do ILSVRC em 2010, com 1.000 classes e localização de objetos, uma expansão substancial em relação às 20 classes do PASCAL VOC.

Composição do Conjunto de Dados

O ImageNet recompensa o processo de anotação por meio de multidões. Anotações em nível de imagem indicam a presença ou ausência de uma classe de objeto, enquanto anotações em nível de objeto fornecem caixas delimitadoras ao redor das partes vivíveis. O conjunto de dados usa uma variante do esquema WordNet, aumentado com 120 categorias de raças de cães para classificação de grão fino. Em 30 de abril de 2010, o conjunto de dados continha 21.841 synsets (conjuntos de sinônimos) não concretos, 14.197.122 imagens, 1.034.908 imagens com anotações de caixa delimitadora e 1,2 milhões de imagens com características SIFT.

As categorias foram filtradas des termos do WordNet, que são chamados de synsets. Cada synset possui um ID do WordNet (wnid) começando com "n" porque o ImageNet inclui apenas substantivos. As categorias se distribuem em 9 níveis, do nível 1 (por exemplo, "mamífero") ao nível 9 (por exemplo, "pastor alemão"). As imagens foram raspidas de mecanismos de busca on-line como Google, Picsearch, MSN, Yahoo e Flickr usando sinônimos em múltiplos idiomas. As imagens estão em formato RGB com resoluçãoções variáveis; por exemplo, na categoria "peixe" de 2012, as resoluções variam de 4288 x 2848 a 75 x 56. Em aprendizado de máquina, normalmente são pré-processadas para uma resoluçãoção padrão e branqueadação antes de serem processadas por redes neurais.

Importância para o Aprendizado Profundo

O ILSVRC 2010 preparou eclosão para um grande avanço em 2012. Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcançou um erro de topo-5 de 15.3% na competição ImageNet 2012, mais de 10.8 pontos percentuais abaixo do segundo colocado. Esse sucesso foi possibilitado pelo uso de unidades gráficas de processamento (GPUs) durante o treinamento, um ingrediente essencial da revolução do aprendizado profundo. Segundo a The Economist República de: "De repente as pessoas começaram a prestar atenção, não apenas dentro da comunidade de IA, mas em toda a indústria de tecnologia como um mundo".

Em 2015, a AlexNet foi superada pela CNN profunda da Microsoft, com mais de 100 camadas, que venceu o concurso ImageNet 2015 com uma taxa de erro de 2,57%. Andrej Karpathy estimou em 2014 que, com esforço concentrado, ele poderia alcançar uma taxa de erro de 2.4%, e cerca de 10 cidadãos de seu laboratório alcançaram cerca de 12.3% com menos esforço. Estimava-se que, com esforço máximo, um ser humano poderia obter uma taxa de erro de 2,4%.

Legado

Embora o ILSVRC 2010 em si não tenha contado com vencedores de aprendizado profundo, ele estabeleceu o benchmark que impulsionaria o progresso rápido na visão computacional. A plataforma de avaliação em larga escala e padronizada do desafio tornou-se um catalisador para o desenvolvimento de redes neurais e técnicas de aprendizado profundo, influenciando pesquisas subsequentes em inteligência artificial e áreas relacionadas. O conjunto de dados e o desafio permanecem influentes, com a edição de 2010 servindo como base para competições posteriores que nacionalizaram o poder das abordagens de aprendizado de máquina.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·image-classification·machine-learning·benchmark
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico