ImageNet-1K es un subconjunto estandarizado de la base de datos visual ImageNet, que contiene exactamente 1.000 clases de objetos no superpuestas. Se introdujo como punto de referencia de clasificación y localización para el ImageNet Large Scale Visual Recognition Challenge (ILSVRC), que comenzó en 2010. El subconjunto se derivó del conjunto de datos más grande de ImageNet, que contiene más de 14 millones de imágenes anotadas manualmente en más de 20.000 categorías, seleccionando una lista recortada de clases que son sustantivos contables y visualmente distintos. ImageNet-1K se convirtió en un punto de referencia crítico en el aprendizaje automático y el aprendizaje profundo, sirviendo como banco de pruebas principal para los avances en las arquitecturas de redes neuronales y las técnicas de entrenamiento durante la década de 2010.
Las imágenes del conjunto de datos provienen de URL de terceros y no son propiedad de ImageNet en sí. Cada imagen está etiquetada con exactamente un identificador de clase, conocido como ID de WordNet (wnid), que corresponde a un synset en la base de datos léxica WordNet. Las categorías abarcan una amplia gama de objetos cotidianos, desde animales y plantas hasta vehículos y artículos para el hogar, e incluyen 120 clases de razas de perros de grano fino para probar la discriminación sutil. Las imágenes de ImageNet-1K están en formato RGB con resoluciones variables, típicamente preprocesadas a un tamaño fijo y normalizadas antes de ser introducidas en los modelos.
Historia y Creación
La investigadora de IA Fei-Fei Li concibió el proyecto ImageNet en 2006, con el objetivo de cambiar el enfoque de la investigación en IA de los algoritmos a los datos a gran escala. En 2007, se reunió con la profesora de Princeton Christiane Fellbaum, creadora de WordNet, y decidió construir el conjunto de datos utilizando la jerarquía de sustantivos de WordNet como columna vertebral. El proyecto comenzó el etiquetado en julio de 2008 utilizando Amazon Mechanical Turk, con 49.000 trabajadores de 167 países filtrando más de 160 millones de imágenes candidatas. El etiquetado concluyó en abril de 2010, con cada una de las 14 millones de imágenes verificada tres veces.
El plan original contemplaba 40.000 categorías con 10.000 imágenes cada una, pero las restricciones prácticas, incluida la velocidad de clasificación humana de aproximadamente 2 imágenes por segundo, llevaron a un alcance reducido. La primera presentación pública fue un póster en la Conferencia sobre Visión por Computador y Reconocimiento de Patrones (CVPR) de 2009 en Florida. En 2009, Alex Berg sugirió añadir la localización de objetos, lo que llevó a una colaboración con el concurso PASCAL Visual Object Classes y al lanzamiento de ILSVRC en 2010 con 1.000 clases.
Papel en el Aprendizaje Profundo
ImageNet-1K ganó prominencia el 30 de septiembre de 2012, cuando una red neuronal convolucional llamada AlexNet logró un error top-5 del 15,3% en el ImageNet 2012 Challenge, más de 10,8 puntos porcentuales mejor que el subcampeón. Este éxito fue posible gracias al entrenamiento en unidades de procesamiento gráfico (GPU), un ingrediente clave de la revolución del aprendizaje profundo. El resultado atrajo la atención de la industria tecnológica, como señaló The Economist.
Los años siguientes vieron un progreso rápido. En 2015, la CNN muy profunda de Microsoft con más de 100 capas ganó el concurso ImageNet 2015 con una tasa de error del 3,57%. El rendimiento humano fue estimado por Andrej Karpathy en 2014 en alrededor del 5,1% con esfuerzo concentrado, y potencialmente del 2,4% con esfuerzo máximo, lo que indica que los modelos pronto se acercaron o superaron la clasificación a nivel humano en este punto de referencia. ImageNet-1K se convirtió en el conjunto de evaluación estándar para innovaciones como las arquitecturas de redes residuales, normalización por lotes y técnicas de aumento de datos.
Estructura del Conjunto de Datos
Las categorías de ImageNet-1K se filtran de WordNet 3.0, que contiene más de 80.000 synsets de sustantivos. El proceso de selección retuvo 21.841 synsets para el ImageNet completo, y el subconjunto de 1.000 clases se eligió para ILSVRC. Cada synset tiene un wnid único, como "n02084071" para "perro, perro doméstico, Canis familiaris". Las categorías se organizan en una jerarquía de 9 niveles, desde conceptos amplios como "mamífero" hasta razas específicas como "pastor alemán".
Las imágenes se extrajeron de motores de búsqueda en línea, incluidos Google, Picsearch, MSN, Yahoo y Flickr, utilizando sinónimos en varios idiomas. Por ejemplo, la categoría de pastor alemán utilizó consultas como "Alsatian" y "pastore tedesco". Las resoluciones varían ampliamente, desde 4288 x 2848 hasta 75 x 56 píxeles en la categoría de peces. En la práctica, las imágenes se redimensionan a una resolución constante y se blanquean; por ejemplo, PyTorch normaliza dividiendo los valores de píxeles a [0,1], restando la media [0.485, 0.456, 0.406] y dividiendo por la desviación estándar [0.229, 0.224, 0.225].
Anotaciones y Uso
Cada imagen de ImageNet-1K lleva una única etiqueta de clase. El ImageNet completo también proporciona anotaciones de cuadros delimitadores para aproximadamente 1 millón de imágenes en alrededor de 3.000 synsets populares, lo que permite tareas de localización de objetos. Se publicaron características SIFT densas para el subconjunto de 1.000 clases, diseñadas para enfoques de bolsa de palabras visuales, aunque estos se volvieron menos comunes con el auge del aprendizaje profundo.
A partir del resumen de 2010, ImageNet tenía 21.841 synsets no vacíos, 14.197.122 imágenes y 1.034.908 imágenes con cuadros delimitadores. Las anotaciones del conjunto de datos están disponibles gratuitamente, pero las imágenes en sí no son propiedad de ImageNet. ImageNet-1K sigue siendo ampliamente utilizado para el preentrenamiento y la evaluación comparativa en inteligencia artificial, a pesar de la aparición de conjuntos de datos más grandes y puntos de referencia alternativos.
Legado e Impacto
El éxito de AlexNet en ImageNet-1K catalizó el auge del aprendizaje profundo, influyendo en campos más allá de la visión por computador, incluido el procesamiento del lenguaje natural y el desarrollo de modelos de lenguaje grandes. Los métricas claras del punto de referencia y su gran escala lo convirtieron en un estándar para comparar arquitecturas de modelos, métodos de entrenamiento y eficiencia de hardware. Sin embargo, las preocupaciones sobre el ruido en las anotaciones y la naturaleza estática del conjunto de datos han llevado a críticas, y algunos investigadores han propuesto puntos de referencia más nuevos. No obstante, ImageNet-1K sigue siendo un recurso fundamental en la investigación y educación del aprendizaje automático.