Traducido del inglés

ImageNet es un conjunto de datos de imágenes etiquetadas a gran escala creado por Fei-Fei Li y colaboradores, y la competición anual ILSVRC construida sobre él, cuya edición de 2012 catalizó el auge del aprendizaje profundo.

ImageNet es un conjunto de datos a gran escala de imágenes etiquetadas organizadas según la jerarquía de sustantivos de WordNet y, por extensión, el nombre que se da comúnmente al desafío anual de reconocimiento visual a gran escala de ImageNet (ILSVRC) construido sobre él. Creado por Fei-Fei Li y colegas en Princeton y Stanford a partir de 2006 y presentado por primera vez en 2009, el conjunto de datos creció hasta abarcar aproximadamente 14 millones de imágenes que abarcan más de 20 000 categorías, y el subconjunto ILSVRC utilizado en las competiciones cubría 1000 clases de objetos. A ImageNet se le atribuye ampliamente haber proporcionado la escala de datos necesaria para hacer prácticos los métodos de Deep learning para la Computer vision, y su competición de 2012 se cita con frecuencia como el momento que desencadenó el resurgimiento moderno del campo.

Historia

Fei-Fei Li inició el proyecto ImageNet partiendo de la convicción de que el progreso en el reconocimiento visual estaba limitado menos por los algoritmos que por la ausencia de un conjunto de datos suficientemente grande, diverso y bien etiquetado. Trabajando a partir de la base de datos léxica WordNet, el equipo se propuso recopilar imágenes para cada synset de sustantivos, utilizando la búsqueda de imágenes en la web para reunir candidatas y el crowdsourcing a través de Amazon Mechanical Turk para verificar las etiquetas. El conjunto de datos completo se presentó en la Conferencia IEEE de 2009 sobre Visión por Computador y Reconocimiento de Patrones, y la competición ILSVRC se lanzó al año siguiente, enfrentando a equipos de investigación entre sí en tareas de clasificación y detección sobre un subconjunto reservado de aproximadamente 1,2 millones de imágenes de entrenamiento.

El hito de 2012

El ILSVRC de 2012 es el momento más conocido del conjunto de datos. Una Convolutional neural network presentada por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton, más tarde denominada AlexNet, redujo la tasa de error top-5 de la competición de alrededor del 26 por ciento a aproximadamente el 15 por ciento, un margen mucho mayor que cualquier mejora anual anterior. El resultado dependió de entrenar una red profunda a la escala de datos etiquetados de ImageNet utilizando hardware GPU (in AI), y se describe con más detalle en el artículo sobre el ImageNet 2012 (AlexNet moment). La victoria convenció a gran parte de la comunidad de visión por computador, que había favorecido las características diseñadas manualmente y otros métodos de Machine learning, de que las redes neuronales profundas entrenadas con grandes conjuntos de datos etiquetados podían superar con creces los enfoques anteriores.

Legado e impacto

Después de 2012, los ganadores del ILSVRC fueron redes profundas casi todos los años, con arquitecturas como VGG, GoogLeNet y ResNet reduciendo progresivamente la tasa de error top-5 por debajo del 5 por ciento en 2015, por debajo de la tasa atribuida típicamente a los anotadores humanos en la misma tarea. El preentrenamiento con ImageNet también se convirtió en una técnica estándar: los modelos entrenados para clasificación en ImageNet se reutilizaban como extractores de características o como puntos de partida para el ajuste fino en otras tareas de visión, un ejemplo temprano a gran escala de Transfer learning. El papel del conjunto de datos como AI benchmark común hizo posible comparar arquitecturas en condiciones consistentes, una práctica que heredarían los puntos de referencia posteriores para modelos de lenguaje y razonamiento. La competición en sí se celebró hasta 2017, año en que los organizadores consideraron que las tasas de error se habían saturado cerca del límite práctico impuesto por el ruido de las propias anotaciones.

Críticas

ImageNet también ha sido objeto de escrutinio como ejemplo de los problemas inherentes a los grandes Training data obtenidos de la web. Los investigadores descubrieron que algunas categorías que no eran objetos en el conjunto completo de 14 millones de imágenes, particularmente en la rama "persona" heredada de WordNet, contenían etiquetas ofensivas o inapropiadas, lo que llevó al equipo de ImageNet a eliminar o difuminar grandes porciones de esa rama en 2019. El episodio se convirtió en un caso de estudio citado con frecuencia en los debates sobre Algorithmic bias y la dificultad de seleccionar responsablemente conjuntos de datos a escala de internet, anticipando debates similares sobre los corpus de texto e imágenes utilizados para preentrenar los modelos generativos posteriores.

Categorías:computer-vision·datasets·history-of-ai·deep-learning
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial