ImageNet es una base de datos visual a gran escala diseñada para su uso en la investigación de software de reconocimiento de objetos visuales. Contiene más de 14 millones de imágenes anotadas manualmente, con más de 20,000 categorías, cada una de las cuales suele constar de varios cientos de imágenes. Al menos un millón de imágenes incluyen anotaciones de cuadros delimitadores. La base de datos de anotaciones y las URL de imágenes de terceros están disponibles gratuitamente, aunque las imágenes reales no son propiedad de ImageNet. Desde 2010, el proyecto ha organizado un concurso de software anual, el ImageNet Large Scale Visual Recognition Challenge (ILSVRC), donde los programas compiten para clasificar y detectar objetos y escenas utilizando una lista recortada de mil clases no superpuestas.
El proyecto se originó a partir de la visión de la investigadora de IA Fei-Fei Li, quien buscaba expandir los datos disponibles para entrenar algoritmos de IA en un momento en que la mayoría de la investigación se centraba en modelos y algoritmos. ImageNet se ha convertido desde entonces en una piedra angular de la revolución del aprendizaje profundo, permitiendo avances en visión por computadora e influyendo en el campo más amplio de la inteligencia artificial.
Historia
Fei-Fei Li comenzó a trabajar en la idea de ImageNet en 2006. En 2007, se reunió con la profesora de Princeton Christiane Fellbaum, una de las creadoras de WordNet, para discutir el proyecto. Esta reunión llevó a Li a construir ImageNet partiendo de los aproximadamente 22,000 sustantivos de WordNet y utilizando muchas de sus características. También se inspiró en una estimación de 1987 de que la persona promedio reconoce aproximadamente 30,000 tipos diferentes de objetos.
Como profesora asistente en Princeton, Li reunió a un equipo de investigadores para trabajar en el proyecto. Utilizaron Amazon Mechanical Turk para ayudar con la clasificación de imágenes. El etiquetado comenzó en julio de 2008 y terminó en abril de 2010, involucrando a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. El presupuesto permitió que cada una de las 14 millones de imágenes fuera etiquetada tres veces.
El plan original contemplaba 10,000 imágenes por categoría en 40,000 categorías, totalizando 400 millones de imágenes, cada una verificada tres veces. Sin embargo, los humanos pueden clasificar como máximo dos imágenes por segundo, y a ese ritmo se estimó que tomaría 19 años-hombre de trabajo sin descanso. El plan completo no se logró.
La base de datos se presentó por primera vez como un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". El póster se reutilizó en Vision Sciences Society 2009.
En 2009, Alex Berg sugirió agregar la localización de objetos como tarea. Li se acercó al concurso PASCAL Visual Object Classes para una colaboración, lo que resultó en el ImageNet Large Scale Visual Recognition Challenge a partir de 2010. El desafío tenía 1000 clases y localización de objetos, en comparación con PASCAL VOC que tenía solo 20 clases y 19,737 imágenes en 2010.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró un error top-5 del 15.3% en el ImageNet 2012 Challenge, más de 10.8 puntos porcentuales por debajo del subcampeón. El uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento hizo esto factible, un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica".
En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con un error del 3.57% en el conjunto de prueba. Andrej Karpathy estimó en 2014 que con esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y alrededor de 10 personas de su laboratorio alcanzaron alrededor del 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría alcanzar el 2.4%.
Estos resultados demostraron el poder de las arquitecturas de aprendizaje profundo y redes neuronales, acelerando la adopción de técnicas de aprendizaje automático en toda la industria tecnológica.
Conjunto de Datos
ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, como "hay tigres en esta imagen" o "no hay tigres en esta imagen". Las anotaciones a nivel de objeto proporcionan un cuadro delimitador alrededor de la parte visible del objeto indicado. ImageNet utiliza una variante del esquema amplio de WordNet para categorizar objetos, aumentado con 120 categorías de razas de perros para mostrar una clasificación de grano fino.
En 2012, ImageNet era el mayor usuario académico de Mechanical Turk en el mundo. El trabajador promedio identificaba 50 imágenes por minuto.
Las estadísticas resumidas dadas el 30 de abril de 2010:
- Número total de synsets no vacíos: 21,841
- Número total de imágenes: 14,197,122
- Número de imágenes con anotaciones de cuadros delimitadores: 1,034,908
- Número de synsets con características SIFT: 1,000
- Número de imágenes con características SIFT: 1.2 millones
Categorías
Las categorías de ImageNet se filtraron a partir de conceptos de WordNet. Cada concepto, ya que puede contener múltiples sinónimos (por ejemplo, "kitty" y "young cat"), se denomina "conjunto de sinónimos" o "synset". Había más de 100,000 synsets en WordNet 3.0, siendo la mayoría sustantivos (más de 80,000). El conjunto de datos de ImageNet filtró estos a 21,841 synsets que son sustantivos contables que pueden ilustrarse visualmente.
Cada synset en WordNet 3.0 tiene un "ID de WordNet" (wnid), que es una concatenación de la parte del discurso y un "offset" (un número identificador único). Cada wnid comienza con "n" porque ImageNet solo incluye sustantivos. Por ejemplo, el wnid del synset "dog, domestic dog, Canis familiaris" es "n02084071".
Las categorías en ImageNet se dividen en 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán").
Formato de Imagen
Las imágenes se extrajeron de motores de búsqueda de imágenes en línea (Google, Picsearch, MSN, Yahoo, Flickr, etc.) utilizando sinónimos en varios idiomas. Por ejemplo, para pastor alemán, los términos de búsqueda incluían "German police dog", "Alsatian", "ovejero alemán", "pastore tedesco" y "德国牧羊犬".
ImageNet consiste en imágenes en formato RGB con resoluciones variables. Por ejemplo, en ImageNet 2012, la categoría "pez" tiene resoluciones que van desde 4288 x 2848 hasta 75 x 56. En el aprendizaje automático, estas se preprocesan típicamente a una resolución constante estándar y se blanquean antes de un procesamiento adicional por redes neuronales. Por ejemplo, en PyTorch, las imágenes de ImageNet se normalizan dividiendo los valores de píxeles para que caigan entre 0 y 1, luego restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225]. Estos son las medias y desviaciones estándar para ImageNet, por lo que esto blanquea los datos de entrada.
Etiquetas y Anotaciones
Cada imagen está etiquetada con exactamente un wnid. Las características SIFT densas (descriptores SIFT crudos, palabras de código cuantizadas y coordenadas de cada descriptor/palabra de código) para ImageNet-1K estaban disponibles para descargar, diseñadas para el saco de palabras visuales. Los cuadros delimitadores de objetos estaban disponibles para aproximadamente 3,000 synsets populares con un promedio de 150 imágenes en cada synset. Además, algunas imágenes tienen anotaciones de atributos, aunque el alcance completo de estas no se detalla aquí.
Legado
La creación de ImageNet marcó un cambio hacia enfoques centrados en datos en la IA, influyendo en conjuntos de datos y puntos de referencia posteriores. Su desafío anual se convirtió en un estándar para medir el progreso en visión por computadora, y su éxito catalizó el crecimiento de la IA generativa y otras aplicaciones de IA. El conjunto de datos sigue siendo un recurso fundamental para entrenar y evaluar modelos, y su impacto se extiende a campos como la conducción autónoma y la imagen médica.
A pesar de sus logros, ImageNet también ha planteado preguntas sobre el sesgo y la calidad de las anotaciones, provocando discusiones en la comunidad de IA sobre la curaduría de conjuntos de datos y la ética. No obstante, su papel en el desarrollo de la IA moderna es indiscutible, y continúa siendo ampliamente utilizado en la investigación y la industria.