El Desafío ImageNet, conocido oficialmente como el Desafío de Reconocimiento Visual a Gran Escala ImageNet (ILSVRC), es una competencia anual de software en la que los programas compiten para clasificar y detectar correctamente objetos y escenas en imágenes. Lanzado en 2010, utiliza una lista recortada de mil clases no superpuestas de la base de datos más grande de ImageNet, que contiene más de 14 millones de imágenes anotadas manualmente en más de 20,000 categorías. El desafío se convirtió en un punto de referencia fundamental en visión por computadora, catalizando la revolución del aprendizaje profundo después de 2012.
Historia
La investigadora de IA Fei-Fei Li comenzó a desarrollar el concepto de ImageNet en 2006, con el objetivo de expandir los datos disponibles para entrenar algoritmos de IA en un momento en que la mayoría de la investigación se centraba en modelos. En 2007, Li se reunió con la profesora de Princeton Christiane Fellbaum, creadora de WordNet, y construyó ImageNet a partir de aproximadamente 22,000 sustantivos en WordNet. Se inspiró en una estimación de 1987 de que la persona promedio reconoce alrededor de 30,000 tipos de objetos.
Como profesora asistente en Princeton, Li reunió un equipo que utilizó Amazon Mechanical Turk para la clasificación de imágenes. El etiquetado se realizó de julio de 2008 a abril de 2010, involucrando a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. Cada una de las 14 millones de imágenes fue etiquetada tres veces. El plan original requería 10,000 imágenes por categoría en 40,000 categorías, pero esto no se logró.
La base de datos se presentó por primera vez como un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: Una Vista Previa de un Conjunto de Datos Jerárquico a Gran Escala". En 2009, Alex Berg sugirió agregar la localización de objetos como tarea, lo que llevó a una colaboración con el concurso PASCAL Visual Object Classes. El primer Desafío ImageNet en 2010 tuvo 1,000 clases y localización de objetos, en comparación con las 20 clases y 19,737 imágenes de PASCAL VOC.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró un error top-5 del 15.3% en el Desafío ImageNet 2012, más de 10.8 puntos porcentuales por debajo del subcampeón. Este éxito fue posible gracias al entrenamiento en unidades de procesamiento gráfico (GPU), un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente comenzó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica".
En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57% en el conjunto de prueba. Andrej Karpathy estimó en 2014 que con esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y que con el máximo esfuerzo, un humano podría llegar al 2.4%.
Conjunto de Datos
ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto, mientras que las anotaciones a nivel de objeto proporcionan cajas delimitadoras. El conjunto de datos utiliza una variante del esquema de WordNet, aumentada con 120 categorías de razas de perros para clasificación de grano fino.
Al 30 de abril de 2010, ImageNet tenía 21,841 synsets no vacíos, 14,197,122 imágenes, 1,034,908 imágenes con anotaciones de cajas delimitadoras y 1.2 millones de imágenes con características SIFT. En 2012, ImageNet era el mayor usuario académico de Mechanical Turk en el mundo, con trabajadores que identificaban un promedio de 50 imágenes por minuto.
Categorías
Las categorías se filtran de los conceptos de WordNet, cada una llamada "synset" (conjunto de sinónimos). ImageNet incluye 21,841 synsets que son sustantivos contables e ilustrables visualmente. Cada synset tiene un ID de WordNet (wnid) que comienza con "n" (por ejemplo, "n02084071" para "perro"). Las categorías se dividen en 9 niveles, desde el nivel 1 (por ejemplo, "mamífero") hasta el nivel 9 (por ejemplo, "pastor alemán").
Formato de Imagen
Las imágenes se recopilaron de motores de búsqueda en línea (Google, Picsearch, MSN, Yahoo, Flickr) utilizando sinónimos en varios idiomas. Están en formato RGB con resoluciones variables; por ejemplo, en ImageNet 2012, la categoría "pez" varía de 4288 x 2848 a 75 x 56 píxeles. En el aprendizaje automático, las imágenes se preprocesan típicamente a una resolución estándar y se blanquean. Por ejemplo, en PyTorch, las imágenes se normalizan dividiendo los valores de píxeles a [0,1], restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225].
Etiquetas y Anotaciones
Cada imagen se etiqueta con exactamente un wnid. Las características SIFT densas (descriptores crudos, palabras de código cuantizadas y coordenadas) estaban disponibles para ImageNet-1K, diseñadas para bolsa de palabras visuales. Las cajas delimitadoras estaban disponibles para aproximadamente 3,000 synsets populares con un promedio de 150 imágenes cada uno. Algunas imágenes también tienen anotaciones de atributos, aunque los detalles son limitados.
Legado
El Desafío ImageNet ha sido fundamental para avanzar en las técnicas de aprendizaje automático y aprendizaje profundo. Popularizó el uso de arquitecturas de red neuronal como red residual y métodos de entrenamiento como normalización por lotes y aumento de datos. El éxito de la competencia despertó interés en inteligencia artificial e influyó en desarrollos posteriores en la investigación de IA generativa y modelos de lenguaje grandes, aunque el desafío en sí se centró en tareas visuales.