ImageNet-21K se refiere al conjunto de datos completo de ImageNet, una gran base de datos visual diseñada para la investigación de software de reconocimiento de objetos visuales. Contiene más de 14 millones de imágenes anotadas manualmente organizadas en más de 21,000 categorías, conocidas como synsets, derivadas de la base de datos léxica WordNet. El conjunto de datos está disponible gratuitamente como anotaciones de URL de imágenes de terceros, aunque las imágenes reales no son propiedad de ImageNet. Desde 2010, ImageNet ha organizado un concurso anual, el ImageNet Large Scale Visual Recognition Challenge (ILSVRC), que utiliza un subconjunto recortado de 1,000 clases no superpuestas, comúnmente llamado ImageNet-1K.
Historia
La investigadora de IA Fei-Fei Li comenzó a desarrollar la idea de ImageNet en 2006, con el objetivo de expandir los datos disponibles para entrenar algoritmos de IA. En 2007, se reunió con la profesora de Princeton Christiane Fellbaum, una creadora de WordNet, y posteriormente construyó ImageNet a partir de aproximadamente 22,000 sustantivos en WordNet. Li también se inspiró en una estimación de 1987 de que la persona promedio reconoce alrededor de 30,000 tipos de objetos.
Como profesora asistente en Princeton, Li reunió un equipo y utilizó Amazon Mechanical Turk para la clasificación de imágenes. El etiquetado comenzó en julio de 2008 y terminó en abril de 2010, involucrando a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. Cada una de las 14 millones de imágenes fue etiquetada tres veces. El plan original requería 10,000 imágenes por categoría en 40,000 categorías, totalizando 400 millones de imágenes, pero esto no se logró. La primera presentación pública fue un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida.
En 2009, Alex Berg sugirió agregar localización de objetos, lo que llevó a una colaboración con el concurso PASCAL Visual Object Classes y al lanzamiento de ILSVRC en 2010, que presentó 1,000 clases y localización de objetos, en comparación con las 20 clases de PASCAL VOC.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró un error top-5 del 15.3% en el Desafío ImageNet 2012, más de 10.8 puntos porcentuales por debajo del subcampeón. Este éxito fue posible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, un factor clave en la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica".
En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57%. Andrej Karpathy estimó en 2014 que con esfuerzo concentrado, podría alcanzar un error del 5.1%, y alrededor de 10 personas de su laboratorio alcanzaron aproximadamente un 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría lograr un error del 2.4%.
Conjunto de Datos
ImageNet externaliza su proceso de anotación mediante crowdsourcing. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto, mientras que las anotaciones a nivel de objeto proporcionan cajas delimitadoras alrededor de los objetos visibles. El conjunto de datos utiliza una variante del esquema de WordNet, aumentada con 120 categorías de razas de perros para la clasificación de grano fino. En 2012, ImageNet fue el mayor usuario académico de Mechanical Turk en el mundo, con trabajadores identificando un promedio de 50 imágenes por minuto.
A partir del 30 de abril de 2010, el conjunto de datos tenía 21,841 synsets no vacíos, 14,197,122 imágenes, 1,034,908 imágenes con anotaciones de cajas delimitadoras y 1.2 millones de imágenes con características SIFT (para 1,000 synsets).
Categorías
Las categorías se filtraron de los conceptos de WordNet, cada una llamada "synset" (conjunto de sinónimos). WordNet 3.0 contiene más de 100,000 synsets, principalmente sustantivos (más de 80,000), e ImageNet los filtró a 21,841 sustantivos contables que pueden ilustrarse visualmente. Cada synset tiene un ID de WordNet (wnid), que comienza con "n" porque solo se incluyen sustantivos; por ejemplo, el wnid para "perro, perro doméstico, Canis familiaris" es "n02084071". Las categorías abarcan 9 niveles, desde el nivel 1 (por ejemplo, "mamífero") hasta el nivel 9 (por ejemplo, "pastor alemán").
Formato de Imagen
Las imágenes se extrajeron de motores de búsqueda en línea (Google, Picsearch, MSN, Yahoo, Flickr) utilizando sinónimos en varios idiomas. Están en formato RGB con resoluciones variables; por ejemplo, en la versión de 2012, la categoría "pez" varía de 4288 x 2848 a 75 x 56 píxeles. En aprendizaje automático, las imágenes se preprocesan típicamente a una resolución constante y se blanquean. En PyTorch, las imágenes de ImageNet se normalizan dividiendo los valores de píxeles a [0,1], restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225], que son la media y las desviaciones estándar del conjunto de datos.
Etiquetas y Anotaciones
Cada imagen se etiqueta con exactamente un wnid. Las características SIFT densas (descriptores crudos, palabras de código cuantizadas y coordenadas) están disponibles para ImageNet-1K, diseñadas para modelos de bolsa de palabras visuales. Las cajas delimitadoras están disponibles para aproximadamente 3,000 synsets populares, con un promedio de 150 imágenes por synset. Algunas imágenes también tienen anotaciones de atributos.
Impacto y Legado
ImageNet-21K ha sido fundamental para avanzar en la investigación de inteligencia artificial y visión por computadora. El desafío ILSVRC, particularmente el resultado de AlexNet en 2012, catalizó la adopción generalizada de métodos de red neuronal y aprendizaje profundo. La escala y la estructura jerárquica del conjunto de datos han permitido el entrenamiento de modelos grandes, influyendo en desarrollos posteriores en IA generativa y otros campos. Aunque el conjunto completo de 21K se usa menos comúnmente que el subconjunto de 1K para la evaluación comparativa, sigue siendo un recurso valioso para el preentrenamiento y la investigación en clasificación de grano fino.