Creación de ImageNet

Traducido del inglés

ImageNet es una base de datos visual a gran escala creada por Fei-Fei Li y sus colegas, que contiene más de 14 millones de imágenes anotadas utilizadas para entrenar y evaluar algoritmos de reconocimiento visual de objetos. Lanzada en 2009, se convirtió en un elemento central de la revolución del aprendizaje profundo tras el éxito de AlexNet en 2012.

ImageNet es una base de datos visual a gran escala diseñada para la investigación en software de reconocimiento de objetos visuales. El proyecto comprende más de 14 millones de imágenes anotadas manualmente que indican los objetos representados, con al menos un millón de imágenes que también proporcionan cuadros delimitadores. Contiene más de 20,000 categorías, cada una de las cuales suele consistir en varios cientos de imágenes. La base de datos de URL de imágenes de terceros y sus anotaciones está disponible gratuitamente, aunque las imágenes reales no son propiedad de ImageNet. Desde 2010, ImageNet ha organizado una competencia anual, el Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC), donde los programas de software compiten para clasificar y detectar objetos y escenas utilizando una lista recortada de mil clases no superpuestas.

El proyecto se originó a partir de la visión de la investigadora de IA Fei-Fei Li, quien comenzó a trabajar en la idea en 2006, con el objetivo de expandir y mejorar los datos disponibles para entrenar algoritmos de IA. En ese momento, la mayor parte de la investigación en IA se centraba en modelos y algoritmos, pero Li buscaba abordar el cuello de botella de los datos. En 2007, Li se reunió con la profesora de Princeton Christiane Fellbaum, una creadora de WordNet, y posteriormente construyó ImageNet a partir de los aproximadamente 22,000 sustantivos de WordNet, incorporando muchas de sus características. Li también se inspiró en una estimación de 1987 de que la persona promedio reconoce alrededor de 30,000 tipos diferentes de objetos. Como profesora asistente en Princeton, Li reunió un equipo de investigación y utilizó Amazon Mechanical Turk para ayudar en la clasificación de imágenes. El etiquetado comenzó en julio de 2008 y terminó en abril de 2010, con 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas, con un presupuesto suficiente para que cada una de las 14 millones de imágenes fuera etiquetada tres veces.

La base de datos se presentó por primera vez como un póster en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: Una Vista Previa de un Conjunto de Datos Jerárquico a Gran Escala". En 2009, Alex Berg sugirió agregar la localización de objetos como una tarea, lo que llevó a la colaboración con el concurso PASCAL Visual Object Classes y al inicio del Desafío de Reconocimiento Visual a Gran Escala de ImageNet en 2010, que presenta 1000 clases y localización de objetos, mucho más que las 20 clases y 19,737 imágenes de PASCAL VOC en 2010.

Construcción del Conjunto de Datos

ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, como "hay tigres en esta imagen" o "no hay tigres en esta imagen". Las anotaciones a nivel de objeto proporcionan un cuadro delimitador alrededor de la parte visible del objeto indicado. ImageNet utiliza una variante del esquema amplio de WordNet para categorizar objetos, aumentado con 120 categorías de razas de perros para una clasificación de grano fino. En 2012, ImageNet fue el mayor usuario académico de Mechanical Turk en el mundo, donde el trabajador promedio identificaba 50 imágenes por minuto. El plan original para el ImageNet completo era de aproximadamente 50 millones de imágenes limpias, diversas y de resolución completa distribuidas en aproximadamente 50,000 synsets, pero esto no se logró.

Estadísticas resumidas al 30 de abril de 2010:

  • Número total de synsets no vacíos: 21,841
  • Número total de imágenes: 14,197,122
  • Número de imágenes con anotaciones de cuadros delimitadores: 1,034,908
  • Número de synsets con características SIFT: 1,000
  • Número de imágenes con características SIFT: 1.2 millones

Categorías y Formato de Imagen

Las categorías de ImageNet se filtraron a partir de conceptos de WordNet. Cada concepto, que puede contener sinónimos, se denomina "conjunto de sinónimos" o "synset". Aunque WordNet 3.0 tenía más de 100,000 synsets, principalmente sustantivos (más de 80,000), ImageNet centró el recuento de sustantivos contables en 21,841 synsets que pueden ilustrarse visualmente. Cada synset tiene un ID de WordNet (wnid), una concatenación de la parte del discurso y un desplazamiento; todos los wnid comienzan con "n" ya que ImageNet solo incluye sustantivos. Por ejemplo, el wnid para "perro, perro doméstico, Canis familiaris" es "n02084071". Las categorías abarcan 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán").

Las imágenes se extrajeron de búsquedas de imágenes en línea utilizando sinónimos multilingües. Vienen en formato RGB con resoluciones variables. Por ejemplo, en la categoría "pez" de ImageNet 2012, la resolución varía de 4288 x 2848 a 75 x 56. En el aprendizaje automático, estas imágenes suelen preprocesarse a una resolución constante estándar y blanquearse antes del entrenamiento. Por ejemplo, en PyTorch, las imágenes se normalizan dividiendo los valores de píxeles para que caigan entre 0 y 1, luego se resta la media [0.485, 0.456, 0.406] y se divide por la desviación estándar [0.229, 0.224, 0.225]. Estas estadísticas se derivan de ImageNet.

Etiquetas y Anotaciones

Cada imagen se etiqueta con exactamente un wnid. Las características SIFT densas (incluidos descriptores SIFT crudos, palabras de código cuantizadas y coordenadas) para ImageNet-1K estaban disponibles para descargar, diseñadas para un enfoque de bolsa de palabras. Los cuadros delimitadores para objetos estaban disponibles para aproximadamente 3,000 synsets, con un promedio de 150 imágenes cada uno. Algunas imágenes tienen anotaciones de atributos, aunque los detalles no están completamente especificados. El conjunto de datos también incluye algunos synsets con características SIFT para 1.2 millones de imágenes.

Importancia para el Aprendizaje Profundo

ImageNet ha desempeñado un papel fundamental en la revolución del aprendizaje profundo. El 30 de septiembre de 2012, una red neuronal convolucional llamada AlexNet logró una tasa de error top-5 del 15.3% en el Desafío ImageNet 2012, más de 10.8 puntos porcentuales por debajo del subcampeón. Este éxito fue posible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, que se convirtieron en un ingrediente esencial para la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente comenzó a prestar atención, no solo dentro de la comunidad de IA sino en toda la industria tecnológica". En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57%. En 2014, Andrej Karpathy estimó que con un esfuerzo concentrado podría alcanzar una tasa de error del 5.1%, y alrededor de 10 personas de su laboratorio alcanzaron aproximadamente un 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría alcanzar aproximadamente un error del 2.4%.

El impacto de ImageNet se extiende mucho más allá de la competencia en sí. La disponibilidad de un conjunto de datos grande, estructurado y etiquetado permitió a los investigadores entrenar y evaluar modelos con una escala y variedad sin precedentes. Esto impulsó la adopción de innovaciones de Deep learning como redes neuronales, redes residuales y técnicas como aumento de datos y normalización por lotes. También aceleró el progreso en aprendizaje automático y inteligencia artificial, y sus tareas de referencia, como la clasificación y la localización, se han convertido en fundamentales para evaluar sistemas de visión por computadora. La organización del conjunto de datos a través de WordNet ha influido en otros conjuntos de datos a gran escala y flujos de trabajo estándar en PyTorch y otros marcos.

La disponibilidad pública de ImageNet también ha tenido un impacto más amplio. Ha sido utilizado por muchos grupos de investigación y empresas, incluidos Google DeepMind, OpenAI y Microsoft, para entrenar y evaluar modelos. Su influencia se extiende al desarrollo de arquitecturas de transformadores que desde entonces se han convertido en estándar en el modelado de lenguaje. En los últimos años, ImageNet sigue siendo una referencia esencial para la investigación en visión por computadora, aunque el conjunto de datos también ha suscitado discusiones sobre derechos de autor y privacidad, debido al uso de imágenes de terceros. A pesar de estas preocupaciones, la escala y estructura de ImageNet continúa inspirando conjuntos de datos similares en diferentes dominios, como ImageNet, pero el enfoque permanece en el ImageNet original y su papel en el avance del reconocimiento visual.

Fuentes e Impacto

En resumen, la creación de ImageNet fue un evento histórico en la historia de la inteligencia artificial. Proporcionó un conjunto de datos integral y escalable que destacó la importancia de los enfoques basados en datos. Su influencia en el auge del aprendizaje profundo no puede subestimarse, ya que permitió avances en algoritmos y hardware que resultaron en la era actual de IA generativa y modelos grandes. A partir de 2025, ImageNet sigue sirviendo como referencia para evaluar nuevos métodos y teorías, como aquellos que involucran transformadores, modelos de lenguaje grandes y modelos fundacionales. El enfoque de base del proyecto - externalizar anotaciones a través de una comunidad global - también estableció modelos para muchos conjuntos de datos e iniciativas posteriores.

El éxito de ImageNet demostró que los conjuntos de datos a gran escala y de alta calidad no solo son beneficiosos sino a menudo esenciales para el progreso de la IA. Impulsó avances en computación distribuida y servicios en la nube como Amazon Web Services y Google Cloud, así como mejoras de hardware de empresas como NVIDIA y AMD. La competencia en sí, el Desafío de Reconocimiento Visual a Gran Escala de ImageNet, sigue siendo una institución para medir el progreso en visión por computadora. A pesar de la evolución continua de la IA, el legado de ImageNet persiste, desde la investigación académica hasta implementaciones prácticas en vehículos autónomos, imágenes médicas y sistemas multimodales, dando forma a la trayectoria del campo desde IA simbólica hacia redes neuronales y aprendizaje automático. En los años posteriores a su lanzamiento, ImageNet ha influido en el diseño de conjuntos de datos posteriores como COCO y Flickr, que de manera similar buscan proporcionar datos anotados a gran escala para avanzar en la frontera de la inteligencia de las máquinas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·deep-learning·ai·dataset
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial