Traducido del inglés

El Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) 2010 fue la primera competición anual en la que programas de software compitieron para clasificar y detectar objetos en la base de datos de ImageNet, utilizando 1,000 clases no superpuestas y localización de objetos.

La ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2010 fue la edición inaugural de un concurso anual de software organizado por el proyecto ImageNet, una gran base de datos visual diseñada para la investigación en el reconocimiento visual de objetos. El desafío requería que los programas participantes clasificaran y detectaran correctamente objetos y escenas dentro de una lista recortada de mil clases no superpuestas, una escala significativamente mayor que la de referencias anteriores como el concurso PASCAL Visual Object Classes (VOC), que en 2010 utilizaba solo 20 clases y 19,737 imágenes. El desafío de 2010 marcó un punto de inflexión en la visión por computadora al proporcionar una plataforma de evaluación estandarizada y a gran escala que más tarde catalizaría la revolución del aprendizaje profundo.

Orígenes y Desarrollo

El proyecto ImageNet fue concebido por la investigadora de IA Fei-Fei Li en 2006, en un momento en que la mayor parte de la investigación en IA se centraba en modelos y algoritmos en lugar de datos. Li buscaba expandir y mejorar los datos disponibles para entrenar algoritmos de IA. En 2007, se reunió con la profesora de Princeton Christiane Fellbaum, una creadora de WordNet, lo que llevó a construir ImageNet a partir de los aproximadamente 22,000 sustantivos de WordNet. Li también se inspiró en una estimación de 1987 de que la persona promedio reconoce alrededor de 30,000 tipos diferentes de objetos.

Como profesora asistente en Princeton, Li reunió a un equipo de investigadores y utilizó Amazon Mechanical Turk para la clasificación de imágenes. El etiquetado comenzó en julio de 2008 y terminó en abril de 2010, involucrando a 49,000 trabajadores de 167 países que filtraron y etiquetaron más de 160 millones de imágenes candidatas. El plan original preveía 10,000 imágenes por categoría en 40,000 categorías, totalizando 400 millones de imágenes, pero esto se redujo debido a limitaciones prácticas. La base de datos se presentó por primera vez como un póster en la Conferencia de Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulado "ImageNet: Una Vista Previa de un Conjunto de Datos Jerárquico a Gran Escala".

En 2009, Alex Berg sugirió añadir la localización de objetos como tarea, y Li se acercó al concurso PASCAL VOC para colaborar. Esto resultó en el inicio de ILSVRC en 2010, con 1,000 clases y localización de objetos, una expansión sustancial con respecto a las 20 clases de PASCAL VOC.

Composición del Conjunto de Datos

ImageNet externaliza su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto, mientras que las anotaciones a nivel de objeto proporcionan cajas delimitadoras alrededor de las partes visibles de los objetos. El conjunto de datos utiliza una variante del esquema de WordNet, aumentado con 120 categorías de razas de perros para la clasificación de grano fino. Al 30 de abril de 2010, el conjunto de datos contenía 21,841 synsets no vacíos (conjuntos de sinónimos), 14,197,122 imágenes, 1,034,908 imágenes con anotaciones de cajas delimitadoras y 1.2 millones de imágenes con características SIFT.

Las categorías se filtraron de los conceptos de WordNet, que se denominan synsets. Cada synset tiene un ID de WordNet (wnid) que comienza con "n" porque ImageNet solo incluye sustantivos. Las categorías se organizan en 9 niveles, desde el nivel 1 (por ejemplo, "mamífero") hasta el nivel 9 (por ejemplo, "pastor alemán"). Las imágenes se extrajeron de motores de búsqueda en línea como Google, Picsearch, MSN, Yahoo y Flickr utilizando sinónimos en varios idiomas. Las imágenes están en formato RGB con resoluciones variables; por ejemplo, en la categoría "pez" de 2012, las resoluciones varían desde 4288 x 2848 hasta 75 x 56. En el aprendizaje automático, estas se preprocesan típicamente a una resolución estándar y se blanquean antes de ser procesadas por redes neuronales.

Importancia para el Aprendizaje Profundo

La ILSVRC 2010 sentó las bases para un gran avance en 2012. El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet logró un error top-5 del 15.3% en el Desafío ImageNet 2012, más de 10.8 puntos porcentuales menos que el subcampeón. Este éxito fue posible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, un ingrediente esencial de la revolución del aprendizaje profundo. Según The Economist, "De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA, sino en toda la industria tecnológica en su conjunto".

En 2015, AlexNet fue superada por una CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015 con una tasa de error del 3.57%. Andrej Karpathy estimó en 2014 que con un esfuerzo concentrado, podría alcanzar una tasa de error del 5.1%, y alrededor de 10 personas de su laboratorio alcanzaron aproximadamente un 12-13% con menos esfuerzo. Se estimó que con el máximo esfuerzo, un humano podría lograr una tasa de error del 2.4%.

Legado

Aunque la ILSVRC 2010 en sí no presentó ganadores de aprendizaje profundo, estableció el punto de referencia que impulsaría el progreso rápido en la visión por computadora. La evaluación estandarizada y a gran escala del desafío se convirtió en un catalizador para el desarrollo de redes neuronales y técnicas de aprendizaje profundo, influyendo en investigaciones posteriores en inteligencia artificial y campos relacionados. El conjunto de datos y el desafío siguen siendo influyentes, con la edición de 2010 sirviendo como base para competiciones posteriores que mostraron el poder de los enfoques de aprendizaje automático.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·image-classification·machine-learning·benchmark
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial