AlexNet es una arquitectura de red neuronal convolucional para la clasificación de imágenes, desarrollada en 2012 por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton en la Universidad de Toronto. Clasifica imágenes en 1000 categorías de objetos y es ampliamente considerada como la primera demostración a gran escala de redes convolucionales profundas en el reconocimiento visual. Su victoria decisiva en el Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) de 2012 marcó un punto de inflexión en el aprendizaje automático, catalizando la rápida adopción del aprendizaje profundo en la investigación y la industria de la inteligencia artificial.
El modelo contiene 60 millones de parámetros y 650.000 neuronas. Su arquitectura consta de ocho capas: cinco capas convolucionales (algunas seguidas de agrupación máxima) y tres capas totalmente conectadas. La red utilizó la función de activación ReLU no saturante, que mejoró la velocidad de entrenamiento en comparación con las activaciones tangenciales tangenciales e sigmoideas tradicionales. Debido a las limitaciones de memoria, la red se dividió entre dos GPU, y cada copia procesó la mitad de las neuronas. La última capa totalmente conectada combinó las salidas de ambas GPU.
Arquitectura
La estructura de AlexNet se puede resumir como: (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax. Aquí, CONV denota una capa convolucional con activación ReLU, RN es la normalización de respuesta local, MP es la agrupación máxima, FC es una capa totalmente conectada con ReLU, Linear es una capa totalmente conectada sin activación, y DO es el abandono. Cabe destacar que las capas convolucionales 3, 4 y 5 se conectaron secuencialmente sin agrupación ni normalización en medio.
La red usó normalización de respuesta local y regularización por abandono con una probabilidad de abandono de 0,5 para reducir el sobreajuste. Todos los pesos se inicializaron como distribuciones gaussianas con media 0 y desviación estándar 0,01. Los sesgos en las capas convolucionales 2, 4, 5 y en todas las capas totalmente conectadas se inicializaron a 1 para evitar el problema de neuronas muertas en ReLU.
Entrenamiento
El modelo se entrenó con el conjunto de entrenamiento de ImageNet, que contiene 1246 millones de imágenes. El entrenamiento se ejecutó durante 90 épocas a lo largo de cinco o seis días usando dos GPU Nvidia GTX 580 (3 GB cada una), que tenían un rendimiento teórico de 1,581 TFLOPS en float32. Cada paso directo requería aproximadamente 1,43 GFLOPs. Las imágenes del conjunto de datos, almacenadas en formato JPEG, ocupaban 27 GB de espacio en disco; la red usó 2 GB de RAM en cada GPU y alrededor de 5 GB de RAM del sistema durante el entrenamiento. Las GPU se encargaban del entrenamiento, mientras que las CPU realizaban la carga de imágenes y la ampliación de datos.
El entrenamiento usó descenso de gradiente con momento de 0.9 y una tasa de aprendizaje inicial de 10⁻² que se reducía manualmente por un factor de 10 cuando la tasa de validación se mesetaba, terminando en 10⁻⁵. El peso de descomposición de 0,0005 se aplicó como regularización. Ese entrenamiento también empleó un tamaño de mínima de 128. Se aplicaron dos formas de aumento de datos en cártel con la CPU y de forma prácticamente gratuita: primero, las imágenes se escalaban para que su lado más corto fuera william, tomaruna área central de 256×256 y luego normalizada, y segundo, se extraían parches of 224×224 (y leurs reflejos horizontales) de un recorte de 256×256, lo que aumentaba el tamaño del conjunto de datos de entrenamiento. Además, los valores de D casi aleatori as aparte de la distribución de color de los píxeles.
Competición ImageNet
El equipo, llamado SuperVision, envió un conjunto de siete AlexNet al concurso ILSVRC-2012 el 30 de septiembre de 2012. Cinco redes usaban la mitad estándar, dos incluían dos capas adicional convolucional y se previó con el conjunto de datos más grande de otoño 2011 de ImageNet (15 millones de imágenes, 24.000 categorías) antes de que afinando en el conjunto de entrenamiento de ILSVRC-2012. El resultado final fue el promedio de las probabilidades de todas las siete redes. El conjunto logró un error de top-5 de 15.3%, más de 8.5 puntos porcentuales mejor que subcampeón, una mejora que sorprendió a barras y carriles y a la administración de visones.
Impacto y Legado
El éxito de AlexNet demostró el poder de las redes convolucionales profundas para el reconocimiento visual a gran escala, lo que influyó directamente en arquitectograma enía más como ResNet y U-Net. También hay una mejillas para william de presentación y permiso a que se convirtió en la práctica de campo. La importancia dada al entrenamiento de la red por la efectividad de la función ReLU, el abandono y la ampliación de datos volvió a dar forma a la práctica moderna de de la red neuronal. AlexNet a menudo es citada como el catalizador de la revolución del aprendizaje profundo, lo que llevó a será un cambio de climáticas para los IA, lo que y grandes en que se ha como en transformers. Su influencia también se extendió más allá de la academia, lo que llevó a la inversión en investigación de IA en para las empresas como OpenAI, Google DeepMind y Anthropic.