ImageNet 2012 (momento AlexNet)

Traducido del inglés

La ImageNet Large Scale Visual Recognition Challenge de 2012 fue ganada de manera decisiva por AlexNet, una red neuronal convolucional profunda cuya drástica reducción en la tasa de error es ampliamente considerada como el evento que dio inicio a la era moderna del aprendizaje profundo.

El Desafío de Reconocimiento Visual a Gran Escala ImageNet (ILSVRC) de 2012, una competencia anual de visión por computadora construida sobre el conjunto de datos ImageNet, fue ganado por AlexNet, una red neuronal convolucional profunda desarrollada por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton en la Universidad de Toronto. El resultado es ampliamente considerado como el evento único que lanzó la era moderna del aprendizaje profundo.

La competencia

El ILSVRC, celebrado anualmente desde 2010, encargaba a los participantes clasificar imágenes de las aproximadamente 1,2 millones de fotografías de entrenamiento etiquetadas de ImageNet en una de 1.000 categorías de objetos, y se había convertido en el estándar de referencia para el progreso en el reconocimiento de imágenes. Las participaciones de 2010 y 2011 se basaban principalmente en métodos de extracción de características diseñados a mano combinados con clasificadores clásicos de aprendizaje automático, y las mejoras en la tasa de error año tras año habían sido incrementales, generalmente unos pocos puntos porcentuales.

El resultado de AlexNet

La participación de Alex Krizhevsky, entrenada por su equipo utilizando dos GPU comerciales durante aproximadamente una semana, logró una tasa de error top-5 del 15,3%, una mejora dramática frente al 26,2% del segundo lugar, una brecha de casi diez puntos porcentuales que dejó atónita a la comunidad de investigación en visión por computadora, la mayor parte de la cual no había estado utilizando enfoques de redes neuronales profundas. La arquitectura de AlexNet combinaba múltiples capas convolucionales, la función de activación ReLU, regularización por abandono y aumento de datos, técnicas que se conocían individualmente pero que no se habían combinado previamente a esta escala ni entrenado con éxito en hardware de GPU, lo que fue posible en parte gracias a la plataforma CUDA de NVIDIA.

Consecuencias e impacto

La magnitud de la ventaja de AlexNet sobre los métodos competidores cambió la trayectoria de la investigación en inteligencia artificial en aproximadamente dos años: la investigación en visión por computadora se desplazó casi por completo hacia los enfoques de redes neuronales, y la combinación demostrada de grandes conjuntos de datos etiquetados, cómputo con GPU y arquitecturas profundas se convirtió en la plantilla que seguiría el progreso posterior en el procesamiento del lenguaje natural y otros dominios. Los ganadores posteriores del ILSVRC continuaron utilizando redes convolucionales profundas con una profundidad creciente, y para 2015 las tasas de error en el punto de referencia habían caído por debajo del rendimiento humano estimado, lo que llevó a los organizadores de la competencia a retirar la pista de clasificación como efectivamente resuelta. El resultado de 2012 se cita comúnmente, junto con el trabajo original de retropropagación y el posterior artículo Transformer, como uno de los pocos resultados técnicos más responsables del auge del aprendizaje profundo que produjo los grandes modelos de lenguaje de la década de 2020, y consolidó la reputación de Hinton como figura central del campo años antes de su Premio Nobel de 2024.

Categorías:history-of-ai·deep-learning·computer-vision
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial