ImageNet es una base de datos visual a gran escala diseñada para su uso en la investigación de software de reconocimiento de objetos visuales. El proyecto proporciona más de 14 millones de imágenes anotadas manualmente que indican los objetos representados, con al menos un millón de imágenes que también contienen cuadros delimitadores. Abarca más de 20,000 categorías, cada una de las cuales suele contener varios cientos de imágenes. La base de datos de anotaciones para URL de imágenes de terceros está disponible gratuitamente, aunque las imágenes reales no son propiedad de ImageNet. Desde 2010, el proyecto ha organizado un concurso de software anual, el ImageNet Large Scale Visual Recognition Challenge (ILSVRC), donde los programas compiten para clasificar y detectar objetos y escenas utilizando una lista recortada de mil clases no superpuestas.
Historia
La investigadora de IA Fei-Fei Li comenzó a desarrollar la idea de ImageNet en 2006. En un momento en que la mayor parte de la investigación en IA se centraba en modelos y algoritmos, Li buscaba expandir y mejorar los datos disponibles para entrenar algoritmos de IA. En 2007, Li se reunió con la profesora de Princeton Christiane Fellbaum, una de las creadoras de WordNet, para discutir el proyecto. Esta reunión llevó a Li a construir ImageNet partiendo de los aproximadamente 22,000 sustantivos de WordNet y adoptando muchas de sus características. También se inspiró en una estimación de 1987 de que la persona promedio reconoce aproximadamente 30,000 tipos diferentes de objetos.
Como profesora asistente en Princeton, Li reunió a un equipo de investigadores para trabajar en el proyecto. Utilizaron Amazon Mechanical Turk para ayudar a clasificar imágenes. El etiquetado comenzó en julio de 2008 y terminó en abril de 2010, involucrando a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. El presupuesto permitió que cada una de las 14 millones de imágenes fuera etiquetada tres veces. El plan original requería 10,000 imágenes por categoría en 40,000 categorías, totalizando 400 millones de imágenes, cada una verificada tres veces. Sin embargo, los humanos pueden clasificar como máximo 2 imágenes por segundo, y a ese ritmo se estimó que tomaría 19 años-hombre de trabajo sin descanso.
La base de datos se presentó por primera vez como un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: A Preview of a Large-scale Hierarchical Dataset". En 2009, Alex Berg sugirió agregar la localización de objetos como tarea. Li se acercó al concurso PASCAL Visual Object Classes en 2009 para colaborar, lo que resultó en el ImageNet Large Scale Visual Recognition Challenge que comenzó en 2010, con 1000 clases y localización de objetos, en comparación con las 20 clases y 19,737 imágenes de PASCAL VOC.
Importancia para el Aprendizaje Profundo
El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró un error top-5 del 15.3% en el ImageNet 2012 Challenge, más de 10.8 puntos porcentuales por debajo del subcampeón. El uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento hizo factibles las redes neuronales convolucionales, un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica".
En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57% en el conjunto de prueba. Andrej Karpathy estimó en 2014 que con un esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y unas 10 personas de su laboratorio alcanzaron aproximadamente un 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría alcanzar el 2.4%.
Conjunto de Datos
ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, como "hay tigres en esta imagen" o "no hay tigres en esta imagen". Las anotaciones a nivel de objeto proporcionan un cuadro delimitador alrededor de la parte visible del objeto indicado. ImageNet utiliza una variante del amplio esquema de WordNet para categorizar objetos, aumentado con 120 categorías de razas de perros para mostrar una clasificación de grano fino.
En 2012, ImageNet era el mayor usuario académico de Mechanical Turk en el mundo, con el trabajador promedio identificando 50 imágenes por minuto. El plan original para el ImageNet completo habría tenido aproximadamente 50 millones de imágenes limpias, diversas y de resolución completa distribuidas en aproximadamente 50,000 synsets, pero esto no se logró. Las estadísticas resumidas al 30 de abril de 2010 incluían 21,841 synsets no vacíos, 14,197,122 imágenes totales, 1,034,908 imágenes con anotaciones de cuadros delimitadores, 1,000 synsets con características SIFT y 1.2 millones de imágenes con características SIFT.
Categorías
Las categorías de ImageNet se filtraron a partir de los conceptos de WordNet. Cada concepto, dado que puede contener múltiples sinónimos (por ejemplo, "kitty" y "young cat"), se denomina "conjunto de sinónimos" o "synset". WordNet 3.0 tiene más de 100,000 synsets, la mayoría de los cuales son sustantivos (más de 80,000). ImageNet los filtró a 21,841 synsets que son sustantivos contables que pueden ilustrarse visualmente. Cada synset en WordNet 3.0 tiene un "ID de WordNet" (wnid), una concatenación de la parte del discurso y un desplazamiento. Cada wnid comienza con "n" porque ImageNet solo incluye sustantivos; por ejemplo, el wnid para "perro, perro doméstico, Canis familiaris" es "n02084071". Las categorías se dividen en 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán").
Formato de Imagen
Las imágenes se extrajeron de motores de búsqueda de imágenes en línea (Google, Picsearch, MSN, Yahoo, Flickr, etc.) utilizando sinónimos en múltiples idiomas, como "pastor alemán", "perro policía alemán", "alsaciano", "ovejero alemán" y "pastore tedesco". ImageNet consiste en imágenes en formato RGB con resoluciones variables; por ejemplo, en la categoría "pez" de ImageNet 2012, las resoluciones van desde 4288 x 2848 hasta 75 x 56. En el aprendizaje automático, estas se preprocesan típicamente a una resolución constante estándar y se blanquean antes de un procesamiento adicional por redes neuronales. Por ejemplo, en PyTorch, las imágenes de ImageNet se normalizan dividiendo los valores de píxeles para que caigan entre 0 y 1, luego restando [0.485, 0.456, 0.406] y dividiendo por [0.229, 0.224, 0.225], que son las medias y desviaciones estándar de ImageNet.
Etiquetas y Anotaciones
Cada imagen está etiquetada con exactamente un wnid. Las características SIFT densas (descriptores SIFT crudos, palabras de código cuantificadas y coordenadas) para ImageNet-1K estaban disponibles para descargar, diseñadas para modelos de bolsa de palabras visuales. Los cuadros delimitadores estaban disponibles para aproximadamente 3,000 synsets populares, con un promedio de 150 imágenes por synset. Además, algunas imágenes tienen anotaciones de atributos, y el conjunto de datos se ha utilizado ampliamente en la investigación de aprendizaje automático, particularmente para entrenar y evaluar modelos de inteligencia artificial.
Legado e Impacto
ImageNet ha tenido un impacto profundo en el campo de la visión por computadora y la inteligencia artificial. Proporcionó un punto de referencia estandarizado que aceleró el progreso en el reconocimiento y la clasificación de objetos. El éxito de AlexNet en 2012 provocó la revolución del aprendizaje profundo, llevando a la adopción generalizada de técnicas de aprendizaje profundo en diversos dominios. La estructura jerárquica y la gran escala de ImageNet también han influido en el desarrollo de otros conjuntos de datos y en el diseño de modelos basados en transformadores, que más tarde se convirtieron en fundamentales en la IA generativa y los grandes modelos de lenguaje. El conjunto de datos sigue siendo un recurso crítico para entrenar y evaluar sistemas de reconocimiento visual, y su legado continúa dando forma a la investigación y las aplicaciones de IA.