La ImageNet Large Scale Visual Recognition Challenge (ILSVRC) fue una competición anual de software celebrada de 2010 a 2017 como parte del proyecto ImageNet. Su objetivo era que los algoritmos clasificaran y detectaran correctamente objetos y escenas dentro de un conjunto curado de 1,000 clases de objetos no superpuestas. Se atribuye ampliamente a este desafío el haber catalizado la revolución del aprendizaje profundo en la visión por computadora, especialmente después de 2012, cuando una red neuronal convolucional logró una mejora drástica en precisión.
La competición surgió del proyecto ImageNet, una gran base de datos visual diseñada para la investigación en reconocimiento de objetos. Iniciada por la investigadora Fei-Fei Li, ImageNet contiene más de 14 millones de imágenes anotadas manualmente que abarcan más de 20,000 categorías, y al menos un millón de ellas incluyen anotaciones de cuadros delimitadores. La ILSVRC utilizó un subconjunto de estas imágenes y categorías para proporcionar un punto de referencia estandarizado para evaluar y comparar algoritmos de visión por computadora.
Historia
Fei-Fei Li comenzó a conceptualizar ImageNet en 2006, con el objetivo de expandir los datos disponibles para entrenar algoritmos de IA en una época en que la investigación se centraba principalmente en modelos y algoritmos. En 2007, conoció a la profesora de Princeton Christiane Fellbaum, una de las creadoras de WordNet, lo que la llevó a construir ImageNet basándose en los aproximadamente 22,000 sustantivos de WordNet. Li también se inspiró en una estimación de 1987 que sugería que una persona promedio reconoce alrededor de 30,000 tipos diferentes de objetos.
Como profesora asistente en Princeton, Li reunió un equipo y utilizó Amazon Mechanical Turk para la clasificación de imágenes. El etiquetado se llevó a cabo desde julio de 2008 hasta abril de 2010, e involucró a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. Cada una de las 14 millones de imágenes fue etiquetada tres veces. El plan original contemplaba 10,000 imágenes por categoría en 40,000 categorías, pero esto resultó poco práctico; dado que los humanos pueden clasificar como máximo 2 imágenes por segundo, se habría requerido un estimado de 19 años-hombre de trabajo.
La base de datos se presentó por primera vez como un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". En 2009, Alex Berg sugirió añadir la localización de objetos como tarea, lo que llevó a una colaboración con el concurso PASCAL Visual Object Classes. La primera ILSVRC se celebró en 2010, con 1,000 clases y localización de objetos, en comparación con las 20 clases y 19,737 imágenes de PASCAL VOC.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró una tasa de error top-5 del 15.3% en el desafío ImageNet 2012, más de 10.8 puntos porcentuales mejor que el subcampeón. Este éxito fue posible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica".
En 2015, AlexNet fue superada por una CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57% en el conjunto de prueba. Andrej Karpathy estimó en 2014 que, con un esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y que unas 10 personas de su laboratorio lograron aproximadamente un 12-13% con menos esfuerzo. Se estimó que, con el máximo esfuerzo, un humano podría alcanzar una tasa de error del 2.4%.
El impacto del desafío se extendió más allá de la visión por computadora, impulsando innovaciones en arquitecturas de redes neuronales, técnicas de entrenamiento y aceleración por hardware. También influyó en el desarrollo de marcos de trabajo de aprendizaje automático y en el campo más amplio de la inteligencia artificial.
Conjunto de Datos
ImageNet utiliza un proceso de anotación colaborativo (crowdsourcing). Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, mientras que las anotaciones a nivel de objeto proporcionan un cuadro delimitador alrededor de la parte visible del objeto. ImageNet utiliza una variante del esquema de WordNet para categorizar objetos, aumentada con 120 categorías de razas de perros para una clasificación más fina.
En 2012, ImageNet era el mayor usuario académico de Mechanical Turk, con un trabajador promedio que identificaba 50 imágenes por minuto. El plan original para ImageNet completo habría requerido aproximadamente 50 millones de imágenes limpias, diversas y de alta resolución distribuidas en unos 50,000 synsets, pero esto no se logró.
A partir del 30 de abril de 2010, las estadísticas resumidas eran las siguientes:
- Número total de synsets no vacíos: 21,841
- Número total de imágenes: 14,197,122
- Número de imágenes con anotaciones de cuadros delimitadores: 1,034,908
- Número de synsets con características SIFT: 1,000
- Número de imágenes con características SIFT: 1.2 millones
Categorías
Las categorías de ImageNet se filtraron a partir de los conceptos de WordNet. Cada concepto, que puede contener múltiples sinónimos (por ejemplo, "kitty" y "young cat"), se denomina "synset" o "conjunto de sinónimos". WordNet 3.0 contiene más de 100,000 synsets, en su mayoría sustantivos (más de 80,000). ImageNet filtró estos a 21,841 synsets que son sustantivos contables y que pueden ilustrarse visualmente.
Cada synset en WordNet 3.0 tiene un "WordNet ID" (wnid), que es una concatenación de la parte de la oración y un desplazamiento. Todos los wnid comienzan con "n" porque ImageNet solo incluye sustantivos. Por ejemplo, el wnid del synset "perro, perro doméstico, Canis familiaris" es "n02084071". Las categorías se organizan en 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán").
Formato de Imagen
ImageNet consta de imágenes en formato RGB con resoluciones variables. Por ejemplo, en la categoría "pez" de ImageNet 2012, las resoluciones varían desde 4288 x 2848 hasta 75 x 56. En el aprendizaje automático, estas imágenes se preprocesan típicamente a una resolución constante estándar y se blanquean antes de ser procesadas por redes neuronales. Por ejemplo, en PyTorch, las imágenes de ImageNet se normalizan dividiendo los valores de píxeles para que estén entre 0 y 1, y luego restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225], que son la media y la desviación estándar de ImageNet.
Etiquetas y Anotaciones
Cada imagen está etiquetada con exactamente un wnid. Las características SIFT densas (descriptores SIFT sin procesar, palabras de código cuantificadas y coordenadas) para ImageNet-1K estaban disponibles para descargar, diseñadas para el enfoque de "bolsa de palabras visuales". Los cuadros delimitadores de objetos estaban disponibles para unos 3,000 synsets populares, con un promedio de 150 imágenes por synset. Además, algunas imágenes tienen anotaciones de atributos, aunque el desafío se centró principalmente en las tareas de clasificación y localización.
La ILSVRC concluyó en 2017, pero su legado persiste en forma del conjunto de datos ImageNet, que sigue siendo un punto de referencia estándar para evaluar modelos de visión por computadora. El énfasis de la competición en datos del mundo real a gran escala y una evaluación rigurosa ayudó a impulsar un progreso rápido en el campo, influyendo en desarrollos posteriores en IA generativa y otras áreas del aprendizaje automático.