Artículo de referencia de AlexNet

Traducido del inglés

AlexNet, una red neuronal convolucional profunda desarrollada en 2012 por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton, ganó el desafío ImageNet con una tasa de error top-5 del 15,3%, lo que desencadenó la revolución del aprendizaje profundo en la visión por computadora.

AlexNet es una arquitectura de red neuronal convolucional desarrollada para la clasificación de imágenes, que alcanzó prominencia notablemente a través de su rendimiento en el Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC). Clasifica imágenes en 1.000 categorías de objetos distintas y está considerada como la primera aplicación ampliamente reconocida de redes convolucionales profundas en el reconocimiento visual a gran escala. Desarrollada en 2012 por Alex Krizhevsky en colaboración con Ilya Sutskever y su asesor de doctorado Geoffrey Hinton en la Universidad de Toronto, el modelo contiene 60 millones de parámetros y 650.000 neuronas. El resultado principal del artículo original fue que la profundidad del modelo era esencial para su alto rendimiento, lo cual era computacionalmente costoso pero factible gracias a la utilización de unidades de procesamiento gráfico (GPU) durante el entrenamiento.

Los tres formaron el equipo SuperVision y presentaron AlexNet en el Desafío de Reconocimiento Visual a Gran Escala de ImageNet el 30 de septiembre de 2012. La red logró una tasa de error top-5 del 15,3% para ganar el concurso, más de 10,8 puntos porcentuales por encima del subcampeón. La arquitectura influyó en una gran cantidad de trabajos posteriores en Deep learning, especialmente en la aplicación de redes neuronales a la visión por computadora.

Arquitectura

AlexNet contiene ocho capas: las primeras cinco son capas convolucionales, algunas de ellas seguidas de capas de max-pooling, y las últimas tres son capas totalmente conectadas. La red, excepto la última capa, está dividida en dos copias, cada una ejecutada en una GPU, porque la red no cabía en la VRAM de una única Nvidia GTX 580 de 3GB. La estructura completa puede escribirse como (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Lineal → softmax, donde CONV = capa convolucional (con activación ReLU), RN = normalización de respuesta local, MP = max-pooling, FC = capa totalmente conectada (con activación ReLU), Lineal = capa totalmente conectada (sin activación), y DO = dropout.

Notablemente, las capas convolucionales 3, 4 y 5 estaban conectadas entre sí sin ningún pooling ni normalización. Utilizaba la función de activación ReLU no saturada, que se entrenaba mejor que tanh y sigmoide. Esta elección fue un factor clave para permitir un entrenamiento más rápido y un mejor rendimiento.

Entrenamiento

El conjunto de entrenamiento de ImageNet contenía 1,2 millones de imágenes. El modelo se entrenó durante 90 épocas en un período de cinco a seis días utilizando dos GPU Nvidia GTX 580 (3GB cada una). Estas GPU tienen un rendimiento teórico de 1,581 TFLOPS en float32 y estaban valoradas en 500 dólares estadounidenses en su lanzamiento. Cada pase hacia adelante de AlexNet requería aproximadamente 1,43 GFLOPs. Basándose en estos valores, las dos GPU juntas eran teóricamente capaces de realizar más de 2.200 pases hacia adelante por segundo en condiciones ideales.

Las imágenes del conjunto de datos se almacenaban en formato JPEG, ocupando 27GB de disco. La red neuronal ocupaba 2GB de RAM en cada GPU y alrededor de 5GB de RAM del sistema durante el entrenamiento. Las GPU eran responsables del entrenamiento, mientras que las CPU eran responsables de cargar las imágenes desde el disco y realizar Data Augmentation en las imágenes.

AlexNet se entrenó con descenso de gradiente con momento con un tamaño de lote de 128 ejemplos, momento de 0,9 y decaimiento de peso de 0,0005. La tasa de aprendizaje comenzó en 10−2 y se disminuyó manualmente 10 veces siempre que el error de validación parecía dejar de disminuir. Se redujo tres veces durante el entrenamiento, terminando en 10−5.

Utilizó dos formas de aumento de datos, ambas calculadas sobre la marcha en la CPU, por lo tanto "computacionalmente gratuitas":

  • Cada imagen de ImageNet se escalaba primero para que su lado más corto tuviera una longitud de 256. Luego se recortaba el parche central de 256×256 y se normalizaba (dividiendo los valores de píxel para que caigan entre 0 y 1, luego restando por [0,485, 0,456, 0,406], y luego dividiendo por [0,229, 0,224, 0,225]. Estos son las medias y desviaciones estándar para ImageNet, por lo que esto blanquea los datos de entrada).
  • Extraer parches aleatorios de 224×224 (y sus reflejos horizontales) del recorte de 256×256. Esto aumenta el tamaño del conjunto de entrenamiento 2048 veces.
  • Desplazar aleatoriamente el valor RGB de cada imagen a lo largo de las tres direcciones principales de los valores RGB de sus píxeles.

La resolución de 224×224 se eligió porque 256 - 16 - 16 = 224, lo que significa que dada una imagen de 256×256, enmarcar un ancho de 16 en sus 4 lados resulta en una imagen de 224×224.

Utilizó normalización de respuesta local y regularización Dropout con probabilidad de abandono de 0,5. Todos los pesos se inicializaron como gaussianas con media 0 y desviación estándar 0,01. Los sesgos en las capas convolucionales 2, 4, 5 y en todas las capas totalmente conectadas se inicializaron a constante 1 para evitar el problema de ReLU moribunda.

En el momento de la prueba, para usar una AlexNet entrenada para predecir la clase de una imagen, esa imagen se escala primero para que su lado más corto tenga una longitud de 256. Luego se recorta el parche central de 256×256. Después, se calculan los cinco parches de 224×224 (los cuatro parches de las esquinas y el parche central) así como sus reflejos horizontales, 10 parches en total. Las probabilidades predichas por la red en los 10 parches se promedian, y esa es la probabilidad final predicha.

Competición ImageNet

La versión utilizada para entrar en la competición ImageNet de 2012 fue un conjunto de 7 AlexNets. Específicamente, entrenaron 5 AlexNets de la arquitectura previamente descrita (con 5 capas CONV) en el conjunto de entrenamiento ILSVRC-2012 (1,2 millones de imágenes). También entrenaron 2 AlexNets variantes, obtenidas añadiendo una capa CONV extra sobre la última capa de pooling. Estas se entrenaron primero en el lanzamiento completo de ImageNet Fall 2011 (15 millones de imágenes en 22K categorías), y luego se ajustaron finamente en el conjunto de entrenamiento ILSVRC-2012. El sistema final de 7 AlexNets se utilizó promediando sus probabilidades predichas.

Historia

Trabajo previo

En 1980, Kunihiko Fukushima propuso una CNN temprana llamada neocognitrón. Fue entrenada por un algoritmo de aprendizaje no supervisado. El LeNet-5 (Yann LeCun et al., 1989) fue entrenado por aprendizaje supervisado con el algoritmo de retropropagación, con una arquitectura que es esencialmente la misma que AlexNet a pequeña escala. El max pooling se utilizó en 1990 para el procesamiento del habla (esencialmente una CNN unidimensional), y para el procesamiento de imágenes, se utilizó por primera vez en el Cresceptron de 1992.

Durante la década de 2000, a medida que mejoraba el hardware de GPU, algunos investigadores adaptaron estas para la computación de propósito general, incluido el entrenamiento de redes neuronales. K. Chellapilla et al. (2006) entrenaron una CNN en GPU que era 4 veces más rápida que una implementación equivalente en CPU. Raina et al. (2009) entrenaron una red de creencia profunda con 100 millones de parámetros en una Nvidia GeForce GTX 280 con una aceleración de hasta 70 veces en comparación con las CPU. Una CNN profunda de Dan Cireșan et al. (2011) en IDSIA era 60 veces más rápida que una implementación equivalente en CPU. Entre el 15 de mayo de 2011 y el 10 de septiembre de 2012, su CNN ganó cuatro competiciones de imágenes y logró el estado del arte para múltiples bases de datos de imágenes. Según el artículo de AlexNet, la red anterior de Cireșan es "algo similar". Ambas fueron escritas con CUDA para ejecutarse en GPU.

Visión por computadora

Durante el período 1990-2010, las redes neuronales no eran mejores que otros métodos de Machine learning como la regresión de kernel, las máquinas de vectores de soporte y otras técnicas clásicas. La victoria decisiva de AlexNet en ILSVRC-2012 demostró que las CNN profundas podían superar estos métodos por un amplio margen, lo que llevó a un cambio de paradigma en la visión por computadora. El éxito de la arquitectura impulsó la adopción rápida del aprendizaje profundo en el campo, influyendo en arquitecturas posteriores como ResNet y muchas otras.

Legado

El impacto de AlexNet se extendió más allá de la visión por computadora, catalizando el auge más amplio de la inteligencia artificial. Demostró la efectividad del aprendizaje profundo a escala, fomentando la inversión en computación basada en GPU y el desarrollo de marcos como CUDA. Los principios de las CNN profundas, incluido el aprendizaje jerárquico de características, se adaptaron posteriormente a otros dominios, incluido el procesamiento del lenguaje natural con transformadores y grandes modelos de lenguaje. El artículo sigue siendo uno de los más citados en el campo, y sus autores - Krizhevsky, Sutskever y Hinton - continuaron con carreras influyentes, con Sutskever cofundando OpenAI y Hinton convirtiéndose en una figura prominente en la investigación de IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·computer-vision·neural-network·imagenet
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial