AlexNet es una red neuronal convolucional diseñada por Alex Krizhevsky, junto con Ilya Sutskever y Geoffrey Hinton, en la Universidad de Toronto. Presentada en la competición ILSVRC-2012, clasificaba fotografías de ImageNet en 1.000 categorías con una tasa de error top-5 del 15,3 por ciento, más de diez puntos porcentuales por delante del siguiente mejor participante, que aún dependía de características de visión por computadora tradicionales y diseñadas a mano. El resultado se considera ampliamente como el punto de partida de la era moderna del aprendizaje profundo.
El nombre de la red es un acortamiento del nombre de pila de su autor principal y no pretendía ser un título de producto formal; el artículo en sí se cita habitualmente simplemente como "ImageNet Classification with Deep Convolutional Neural Networks" (2012).
Historia
Krizhevsky construyó AlexNet como estudiante de posgrado en el laboratorio de Hinton, ampliando los primeros trabajos sobre redes convolucionales de Yann LeCun en la década de 1990. Las redes convolucionales existían desde hacía dos décadas, y el conjunto de datos ImageNet, recopilado por el grupo de Fei-Fei Li, era público desde 2009, pero ningún equipo había combinado una red lo suficientemente profunda con suficiente potencia de cálculo y datos para superar los flujos de visión clásicos. Krizhevsky entrenó el modelo en dos tarjetas GPU de NVIDIA (GTX 580), dividiendo la red entre ellas porque una sola tarjeta no tenía memoria suficiente, utilizando la plataforma CUDA de NVIDIA para escribir él mismo los núcleos de bajo nivel.
Arquitectura
AlexNet tiene ocho capas aprendidas: cinco capas convolucionales seguidas de tres capas totalmente conectadas, con aproximadamente 60 millones de parámetros en total. Varias decisiones la distinguieron de las redes anteriores. Utilizaba la función de activación ReLU (unidad lineal rectificada) en lugar de las funciones sigmoideas o tangentes hiperbólicas saturadas, más lentas, lo que aceleró considerablemente el entrenamiento. Aplicaba dropout, una técnica de regularización, en las capas totalmente conectadas para reducir el sobreajuste en un conjunto de datos de 1,2 millones de imágenes de entrenamiento. Usaba aumento de datos (recortes aleatorios y volteos horizontales) para limitar aún más el sobreajuste, y normalización de respuesta local entre capas, una técnica que las generaciones posteriores de redes eliminaron en su mayoría. El entrenamiento utilizó retropropagación con descenso de gradiente estocástico durante unos seis días en las dos GPU, un compromiso computacional inusualmente grande para un modelo de visión en aquella época.
Impacto y legado
El margen de victoria de AlexNet convenció a gran parte del campo de la visión por computadora, que había sido escéptico con los enfoques de redes neuronales tras los reveses del segundo invierno de la IA, de que la profundidad más la escala más la computación con GPU era una combinación ganadora. Las citas del artículo original se cuentan por decenas de miles, y el artículo se enseña con frecuencia como el ejemplo canónico de un resultado empírico que cambió el campo. La adopción por parte de la industria llegó rápidamente: en dos años, la mayoría de los participantes en el desafío ImageNet usaban redes convolucionales profundas, y empresas como Google, Facebook y Baidu crearon grandes equipos internos de aprendizaje profundo. Las acciones y la estrategia de NVIDIA cambiaron tras AlexNet, ya que las GPU se comercializaron cada vez más para el entrenamiento y no solo para el renderizado de gráficos, una relación que se profundizó en la década siguiente a medida que las redes pasaron de las ocho capas de AlexNet a cientos de capas y, más tarde, a la arquitectura muy diferente del transformador.
La propia AlexNet fue rápidamente superada por redes más profundas como VGGNet, GoogLeNet y ResNet en las competiciones posteriores de ImageNet, y las arquitecturas convolucionales para muchas tareas se han visto desafiadas desde entonces por los transformadores de visión. Su importancia duradera es histórica más que técnica: se cita generalmente como el resultado único que convenció a la comunidad más amplia del aprendizaje automático y la visión por computadora para comprometerse con los métodos de aprendizaje profundo a gran escala, remodelando tanto las prioridades de la investigación académica como la industria del hardware que los respalda.