El ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2012 fue la tercera edición de un concurso de software anual en el que los programas compiten para clasificar y detectar correctamente objetos y escenas de la base de datos ImageNet. El desafío de 2012 es ampliamente considerado como un punto de inflexión en la historia de la inteligencia artificial, ya que la entrada ganadora, una red neuronal llamada AlexNet, logró un error top-5 del 15.3% en el conjunto de prueba, más de 10.8 puntos porcentuales por debajo del subcampeón. Esta mejora dramática demostró el poder de las técnicas de aprendizaje profundo y aprendizaje automático, desencadenando una ola de investigación e inversión que continúa moldeando el campo.
El proyecto ImageNet en sí fue iniciado por la investigadora de IA Fei-Fei Li en 2006, con el objetivo de expandir los datos disponibles para entrenar algoritmos de IA. Li se reunió con la profesora de Princeton Christiane Fellbaum, una de las creadoras de WordNet, en 2007, y posteriormente construyó ImageNet utilizando los aproximadamente 22,000 sustantivos de WordNet como punto de partida. La base de datos se construyó con la ayuda de anotaciones crowdsourced a través de Amazon Mechanical Turk, con el etiquetado comenzando en julio de 2008 y terminando en abril de 2010. El esfuerzo involucró a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas, resultando en más de 14 millones de imágenes anotadas manualmente en más de 20,000 categorías.
Historia y Desarrollo
La idea de ImageNet surgió de la observación de Li de que la mayor parte de la investigación en IA en ese momento se centraba en modelos y algoritmos en lugar de datos. Se inspiró en una estimación de 1987 de que la persona promedio reconoce aproximadamente 30,000 tipos diferentes de objetos. En 2007, Li se reunió con Christiane Fellbaum para discutir el proyecto, y la reunión llevó a la decisión de construir ImageNet partiendo de los synsets de sustantivos de WordNet. Li reunió un equipo de investigadores en Princeton, donde era profesora asistente, y utilizaron Amazon Mechanical Turk para clasificar imágenes.
El plan original contemplaba 10,000 imágenes por categoría, para 40,000 categorías en 400 millones de imágenes, cada una verificada tres veces. Sin embargo, los humanos pueden clasificar como máximo 2 imágenes por segundo, y a ese ritmo se estimó que tomaría 19 años-hombre de trabajo sin descanso. El equipo presentó la base de datos por primera vez como un póster en la Conferencia sobre Visión por Computador y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset."
En 2009, Alex Berg sugirió agregar la localización de objetos como una tarea. Li se acercó a la competencia PASCAL Visual Object Classes para una colaboración, lo que resultó en el inicio del ImageNet Large Scale Visual Recognition Challenge en 2010. El desafío utiliza una lista recortada de 1,000 clases no superpuestas, en comparación con las 20 clases y 19,737 imágenes de PASCAL VOC en 2010.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, AlexNet, una red neuronal convolucional (CNN), logró un error top-5 del 15.3% en el Desafío ImageNet 2012. Esto fue más de 10.8 puntos porcentuales por debajo del subcampeón. El uso de redes neuronales convolucionales fue posible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, que fue un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente comenzó a prestar atención, no solo dentro de la comunidad de IA sino en toda la industria de la tecnología en su conjunto."
La victoria de AlexNet a menudo se cita como el desencadenante del auge del aprendizaje profundo. Demostró que las redes neuronales podían lograr resultados de última generación en tareas visuales complejas, lo que llevó a una rápida adopción de técnicas de aprendizaje profundo en varios dominios, incluidos la IA generativa y los grandes modelos de lenguaje. En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57% en el conjunto de prueba.
Andrej Karpathy estimó en 2014 que con esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y alrededor de 10 personas de su laboratorio alcanzaron aproximadamente 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría alcanzar un error del 2.4%.
Composición del Conjunto de Datos
ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, como "hay tigres en esta imagen" o "no hay tigres en esta imagen." Las anotaciones a nivel de objeto proporcionan una caja delimitadora alrededor de la parte visible del objeto indicado. ImageNet utiliza una variante del esquema amplio de WordNet para categorizar objetos, aumentada con 120 categorías de razas de perros para mostrar la clasificación de grano fino.
En 2012, ImageNet era el mayor usuario académico de Mechanical Turk en el mundo, con el trabajador promedio identificando 50 imágenes por minuto. Las estadísticas resumidas dadas el 30 de abril de 2010 mostraron un total de 21,841 synsets no vacíos, 14,197,122 imágenes, 1,034,908 imágenes con anotaciones de caja delimitadora, y 1.2 millones de imágenes con características SIFT.
Las categorías de ImageNet se filtraron de los conceptos de WordNet. Cada concepto se llama un "synset" (conjunto de sinónimos), y había más de 100,000 synsets en WordNet 3.0, con la mayoría siendo sustantivos (más de 80,000). ImageNet filtró estos a 21,841 synsets que son sustantivos contables que pueden ilustrarse visualmente. Cada synset tiene un ID de WordNet (wnid), que comienza con "n" porque ImageNet solo incluye sustantivos. Las categorías se dividen en 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán").
Formato de Imagen y Preprocesamiento
Las imágenes se extrajeron de motores de búsqueda de imágenes en línea (Google, Picsearch, MSN, Yahoo, Flickr) utilizando sinónimos en múltiples idiomas. ImageNet consiste en imágenes en formato RGB con resoluciones variables. Por ejemplo, en ImageNet 2012, la categoría "pez" tiene resoluciones que van desde 4288 x 2848 hasta 75 x 56. En el aprendizaje automático, estas se preprocesan típicamente a una resolución constante estándar y se blanquean antes de un procesamiento adicional por redes neuronales.
Por ejemplo, en PyTorch, las imágenes de ImageNet se normalizan por defecto dividiendo los valores de píxeles para que caigan entre 0 y 1, luego se resta por [0.485, 0.456, 0.406], y luego se divide por [0.229, 0.224, 0.225]. Estos son las medias y desviaciones estándar para ImageNet, por lo que esto blanquea los datos de entrada.
Etiquetas y Anotaciones
Cada imagen está etiquetada con exactamente un wnid. Las características SIFT densas (descriptores SIFT crudos, codewords cuantizados, y coordenadas de cada descriptor/codeword) para ImageNet-1K estaban disponibles para descarga, diseñadas para el bag of visual words. Las cajas delimitadoras de objetos estaban disponibles para aproximadamente 3,000 synsets populares con un promedio de 150 imágenes en cada synset. Algunas imágenes también tienen anotaciones de atributos, aunque los detalles completos de estas no se especifican en las fuentes disponibles.