ImageNet-21K refere-se ao conjunto de dados ImageNet completo, uma grande base de dados visuais projetada para pesquisa em software de reconhecimento de objetos visuais. Contiene mais de 14 milhões de imagens anotadas manualmente, organizadas em mais de 21.000 categorias, conhecidas como synsets, derivadas da base de dados lexicais WordNet. O conjunto de dados está disponível gratuitamente como anotações de URLs de imagens de terceiros, embora as imagens reais não sejam de propriedade do ImageNet. Desde 2010, ImageNet organiza um concurso anual, o ImageNet Large Scale Visual Recognition Challenge (ILSVRC), que usa um subconjunto reduzido de 1.000 classes não superpostas, comumente chamado ImageNet-1K.
História
A pesquisadora de IA Fei-Fei Li começou a desenvolver a ideia para ImageNet em 2006, visando expandir os dados disponíveis para treinar algoritmos de IA. Em 2007, ela conheceu a professora de Princeton Christiane Fellbaum, uma criadora do WordNet, e posteriormente construiu ImageNet a partir de aproximadamente 22.000 substantivos do WordNet. Li também foi inspirada por uma estimação de 1987 de que a pessoa média reconhece cerca de 30.000 tipos de objetos.
Como professora assistente em Princeton, Li reuniu uma equipe e usou Amazon Mechanical Turk para a classificação de imagens. A rotulação começou em julho de 2008 e terminou em abril de 2010, envolvendo 49.000 trabalhadores de 167 países que filtraram e rotularam mais de 160 milhões de imagens candidatas. Cada uma das 14 milhões de imagens foi rotulada três vezes. O plano original previa 10.000 imagens por categoria em 40.000 categorias, totalizando 400 milhões de imagens, mas isso não foi alcanzado. A primeira apresentação pública foi um póster na Conferência sobre Visão por Computador e Reconhecimento de Padrões (CVPR) de 2009, na Flórida.
Em 2009, Alex Berg sugeriu adicionar localização de objetos, levando a uma colaboração com o concurso PASCAL Visual Object Classes e ao lançamento do ILSVRC em 2010, que apresentava 1.000 classes e localização de objetos, em comparação com as 20 classes do PASCAL VOC.
Importância para o Aprendizado Profundo
Em 30 de setembro de 2012, uma rede neural convolucional (CNN) chamada AlexNet alcanzó um erro top-5 de 15,3% no Desafio ImageNet 2012, mais de 10,8 pontos percentuais abaixo do segundo lugar. Este sucesso foi possibilitado pelo uso de unidades de processamento gráfico (GPUs) durante o treinamento, um fator clave na revolução do Deep learning. Segundo The Economist, "De repente, as pessoas começaram a prestar atenção, não apenas dentro da comunidade de IA, mas em toda a indústria tecnológica."
Em 2015, AlexNet foi superada pela CNN muito profunda da Microsoft, com mais de 100 capas, que venceu o concurso ImageNet 2015 com uma taxa de erro de 3,57%. Andrej Karpathy estimou em 2014 que, com esforço concentrado, poderia alcanzar 5,1% de erro, e cerca de 10 pessoas de seu laboratorio alcanzaron aproximadamente 12-13% com menos esforço. Estimó-se que, com esforzo máximo, um humano poderia alcanzar 2,4% de erro.
Conjunto de Dados
ImageNet terceiriza seu processo de anotação. As anotaciones a nível de imagem indican a presença ou ausência de uma classe de objeto, enquanto as anotaciones a nível de objeto fornecen caixas delimitadoras ao redor de objetos visibles. O conjunto de dados usa uma variante do esquema WordNet, aumentada com 120 categorias de raças de cães para classificação de grano fino. Em 2012, ImageNet era o maior usuário académico de Mechanical Turk do mundo, com trabalhadores identificando uma média de 50 imágenes por minuto.
A partir de 30 de abril de 2010, o conjunto de dados tinha 21.841 synsets não vazios, 14.197.122 imágenes, 1.034.908 imágenes con anotaciones de caixa delimitadora e 1,2 milhões de imágenes con características SIFT (para 1.000 synsets).
Categorías
Las categorías fueron filtradas de los conceptos de WordNet, cada una llamada "synset" (conjunto de sinónimos). WordNet 3.0 contiene más de 100.000 synsets, en su mayoría sustantivos (más de 80.000), e ImageNet filtró estos a 21.841 sustantivos contables que pueden ser ilustrados visualmente. Cada synset tiene un ID de WordNet (wnid), que comienza con "n" porque solo se incluyen sustantivos; por ejemplo, el wnid para "perro, perro doméstico, Canis familiaris" es "n02084071". Las categorías abarcan 9 niveles, desde el nivel 1 (por ejemplo, "mamífero") hasta el nivel 9 (por ejemplo, "pastor alemán").
Formato de Imagen
Las imágenes fueron recopiladas de motores de búsqueda en línea (Google, Picsearch, MSN, Yahoo, Flickr) usando sinónimos en múltiples idiomas. Están en formato RGB con resoluciones variables; por ejemplo, en la versión de 2012, la categoría "pez" varía de 4288 x 2848 a 75 x 56 píxeles. En Machine learning, las imágenes se preprocesan típicamente a una resolución constante y se blanquean. En PyTorch, las imágenes de ImageNet se normalizan dividiendo los valores de píxeles a [0,1], restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225], que son la media y las desviaciones estándar del conjunto de datos.
Etiquetas y Anotaciones
Cada imagen está etiquetada con exactamente un wnid. Las características SIFT densas (descriptores crudos, palabras de código cuantizadas y coordenadas) están disponibles para ImageNet-1K, diseñadas para modelos de bolsa de palabras visuales. Las cajas delimitadoras están disponibles para aproximadamente 3.000 synsets populares, con un promedio de 150 imágenes por synset. Algunas imágenes también tienen anotaciones de atributos.
Impacto y Legado
ImageNet-21K ha sido instrumental en el avance de la investigación en Artificial intelligence y Computer vision. El desafío ILSVRC, particularmente el resultado de AlexNet en 2012, catalizó la adopción generalizada de métodos de Neural network y Deep learning. La escala del conjunto de datos y su estructura jerárquica han permitido el entrenamiento de modelos grandes, influyendo en desarrollos posteriores en Generative AI y otros campos. Aunque el conjunto de datos completo de 21K se usa menos comúnmente que el subconjunto de 1K para evaluaciones comparativas, sigue siendo un recurso valioso para el preentrenamiento y la investigación en clasificación de grano fino.