Traducido del inglés

AlexNet es una red neuronal convolucional profunda desarrollada en 2012 por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton en la Universidad de Toronto, que ganó el desafío de reconocimiento visual a gran escala de ImageNet con una tasa de error top-5 del 15,3%, avanzando significativamente el aprendizaje profundo para la visión por computadora.

AlexNet es una arquitectura de red neuronal convolucional diseñada para la clasificación de imágenes, desarrollada en 2012 por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton en la Universidad de Toronto. Clasifica imágenes en 1,000 categorías de objetos distintas y es ampliamente reconocida como la primera demostración a gran escala de redes convolucionales profundas en el reconocimiento visual. El modelo contiene 60 millones de parámetros y 650,000 neuronas, y su profundidad fue esencial para su alto rendimiento, hecho posible mediante el uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento.

Los tres investigadores formaron el equipo SuperVision y presentaron AlexNet al Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) el 30 de septiembre de 2012. La red logró una tasa de error top-5 del 15.3%, ganando el concurso por un margen de más del 10.8% sobre el subcampeón. Este resultado fue un punto de inflexión para el aprendizaje profundo, influyendo en una gran cantidad de trabajos posteriores en visión por computadora y inteligencia artificial.

Arquitectura

AlexNet contiene ocho capas: las primeras cinco son capas convolucionales, algunas seguidas de capas de agrupación máxima, y las últimas tres son capas completamente conectadas. La red, excepto la última capa, está dividida en dos copias, cada una ejecutándose en una GPU, porque no cabía en la memoria VRAM de 3GB de una sola Nvidia GTX 580. La estructura puede escribirse como (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax, donde CONV es una capa convolucional con activación ReLU, RN es normalización de respuesta local, MP es agrupación máxima, FC es una capa completamente conectada con ReLU, Linear es una capa completamente conectada sin activación, y DO es abandono (dropout).

Notablemente, las capas convolucionales 3, 4 y 5 están conectadas sin agrupación ni normalización. AlexNet utilizó la función de activación ReLU no saturante, que se entrenaba mejor que tanh y sigmoide. Esta elección fue un factor clave en su eficiencia de entrenamiento.

Entrenamiento

El conjunto de entrenamiento de ImageNet contenía 1.2 millones de imágenes. El modelo se entrenó durante 90 épocas en cinco a seis días usando dos GPU Nvidia GTX 580 (3GB cada una), que tienen un rendimiento teórico de 1.581 TFLOPS en float32 y estaban valoradas en US$500 en su lanzamiento. Cada pasada hacia adelante requería aproximadamente 1.43 GFLOPs, por lo que las dos GPU juntas podían teóricamente realizar más de 2,200 pasadas hacia adelante por segundo en condiciones ideales.

Las imágenes del conjunto de datos se almacenaban en formato JPEG, ocupando 27GB de disco. La red neuronal usaba 2GB de RAM en cada GPU y aproximadamente 5GB de RAM del sistema durante el entrenamiento. Las GPU manejaban el entrenamiento, mientras que las CPU cargaban imágenes desde el disco y realizaban aumento de datos.

AlexNet se entrenó con descenso de gradiente con momento, con un tamaño de lote de 128 ejemplos, momento de 0.9 y decaimiento de peso de 0.0005. La tasa de aprendizaje comenzó en 10−2 y se redujo manualmente 10 veces siempre que el error de validación parecía dejar de disminuir, reduciéndose tres veces para terminar en 10−5. Dos formas de aumento de datos se calcularon sobre la marcha en la CPU, haciéndolas "computacionalmente gratuitas": primero, cada imagen se escalaba para que su lado más corto fuera de 256 píxeles, luego se recortaba y normalizaba el parche central de 256×256; segundo, se extraían parches aleatorios de 224×224 (y sus reflejos horizontales), aumentando el tamaño del conjunto de entrenamiento 2048 veces. Además, los valores RGB se desplazaban aleatoriamente a lo largo de las direcciones principales de los valores de píxeles.

La resolución de 224×224 se eligió porque 256 - 16 - 16 = 224, lo que significa que enmarcar 16 píxeles en cada lado de una imagen de 256×256 produce una imagen de 224×224. AlexNet usó normalización de respuesta local y regularización de abandono con una probabilidad de abandono de 0.5. Todos los pesos se inicializaron como gaussianas con media 0 y desviación estándar 0.01, y los sesgos en las capas convolucionales 2, 4, 5 y todas las capas completamente conectadas se inicializaron a constante 1 para evitar el problema de ReLU moribunda.

En el momento de la prueba, una imagen se escala para que su lado más corto sea 256, se recorta el parche central de 256×256, y luego se calculan cinco parches de 224×224 (cuatro esquinas y el centro) más sus reflejos horizontales, dando 10 parches. Las probabilidades predichas por la red en los 10 parches se promedian para producir la predicción final.

Competencia de ImageNet

La versión utilizada para la competencia de ImageNet de 2012 fue un conjunto de siete AlexNets. Cinco AlexNets de la arquitectura estándar se entrenaron en el conjunto de entrenamiento ILSVRC-2012. También se entrenaron dos AlexNets variantes, cada una con una capa convolucional adicional sobre la última capa de agrupación, primero en la versión completa de ImageNet Fall 2011 (15 millones de imágenes en 22K categorías) y luego ajustadas finamente en el conjunto de entrenamiento ILSVRC-2012. El sistema final promedió las probabilidades predichas de las siete redes.

Historia

Trabajo previo

En 1980, Kunihiko Fukushima propuso una CNN temprana llamada neocognitrón, entrenada mediante aprendizaje no supervisado. LeNet-5, desarrollada por Yann LeCun et al. en 1989, usaba aprendizaje supervisado con retropropagación y tenía una arquitectura esencialmente igual a AlexNet a pequeña escala. La agrupación máxima se usó en 1990 para procesamiento de voz y por primera vez para procesamiento de imágenes en el Cresceptron de 1992.

Durante los años 2000, a medida que mejoraba el hardware de GPU, los investigadores adaptaron las GPU para computación de propósito general, incluido el entrenamiento de redes neuronales. En 2006, K. Chellapilla et al. entrenaron una CNN en GPU que era 4 veces más rápida que una implementación equivalente en CPU. En 2009, Raina et al. entrenaron una red de creencias profundas con 100 millones de parámetros en una Nvidia GeForce GTX 280 con una aceleración de hasta 70 veces sobre las CPU. Una CNN profunda de Dan Cireșan et al. en IDSIA en 2011 era 60 veces más rápida que una implementación equivalente en CPU, y entre el 15 de mayo de 2011 y el 10 de septiembre de 2012, su CNN ganó cuatro competencias de imágenes y logró resultados de vanguardia en múltiples bases de datos. Según el artículo de AlexNet, la red anterior de Cireșan es "algo similar" a AlexNet, y ambas fueron escritas con CUDA para ejecutarse en GPU.

Visión por computadora

Durante el período de 1990–2010, las redes neuronales no eran mejores que otros métodos de aprendizaje automático como la regresión de kernel y las máquinas de vectores de soporte. El éxito de AlexNet en 2012 demostró el poder del aprendizaje profundo para la visión por computadora, llevando a la adopción generalizada de las CNN y al desarrollo de arquitecturas posteriores como las redes residuales. También impulsó el interés en la computación basada en GPU para el aprendizaje automático y contribuyó al auge del aprendizaje profundo como enfoque dominante en la IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·computer-vision·neural-network·image-classification
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial