## AlexNet **AlexNet** est un réseau de neurones convolutif (CNN) profond, conçu par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton, et présenté en 2012 lors du concours ImageNet Large Scale Visu

Traduit de l'anglais

AlexNet est un réseau de neurones convolutif profond qui a remporté le défi ImageNet Large Scale Visual Recognition Challenge de 2012 avec une large marge, prouvant que l'apprentissage profond entraîné sur GPU pouvait surpasser la vision par ordinateur conçue à la main et déclenchant l'essor de l'apprentissage profond des années 2010.

AlexNet est un réseau de neurones convolutif conçu par Alex Krizhevsky, avec Ilya Sutskever et Geoffrey Hinton, à l'Université de Toronto. Présenté au concours ILSVRC-2012, il a classé des photographies d'ImageNet en 1 000 catégories avec un taux d'erreur top-5 de 15,3 %, soit plus de dix points de pourcentage d'avance sur le meilleur concurrent suivant, qui reposait encore sur des caractéristiques de vision par ordinateur traditionnelles et conçues manuellement. Ce résultat est largement considéré comme le point de départ de l'ère moderne du apprentissage profond.

Le nom du réseau est une abréviation du prénom de son auteur principal et n'était pas destiné à être un titre de produit formel ; l'article lui-même est généralement cité simplement comme « ImageNet Classification with Deep Convolutional Neural Networks » (2012).

Histoire

Krizhevsky a construit AlexNet en tant qu'étudiant diplômé dans le laboratoire de Hinton, en prolongeant les travaux antérieurs sur les réseaux convolutifs de Yann LeCun dans les années 1990. Les réseaux convolutifs existaient depuis deux décennies, et l'ensemble de données ImageNet, assemblé par le groupe de Fei-Fei Li, était public depuis 2009, mais aucune équipe n'avait combiné un réseau suffisamment profond avec suffisamment de calcul et de données pour surpasser les pipelines de vision classiques. Krizhevsky a entraîné le modèle sur deux cartes GPU NVIDIA (GTX 580), répartissant le réseau entre elles car une seule carte manquait de mémoire, en utilisant la plateforme CUDA de NVIDIA pour écrire lui-même les noyaux de bas niveau.

Architecture

AlexNet comporte huit couches apprises : cinq couches convolutives suivies de trois couches entièrement connectées, soit environ 60 millions de paramètres au total. Plusieurs choix l'ont distingué des réseaux antérieurs. Il utilisait la fonction d'activation ReLU (unité linéaire rectifiée) au lieu des fonctions sigmoïde ou tangente hyperbolique saturantes plus lentes, ce qui accélérait considérablement l'entraînement. Il appliquait le dropout, une technique de régularisation, dans les couches entièrement connectées pour réduire le surapprentissage sur un ensemble de données de 1,2 million d'images d'entraînement. Il utilisait l'augmentation de données (recadrages aléatoires et retournements horizontaux) pour limiter davantage le surapprentissage, ainsi qu'une normalisation de réponse locale entre les couches, une technique que les générations ultérieures de réseaux ont surtout abandonnée. L'entraînement utilisait la rétropropagation avec descente de gradient stochastique sur environ six jours sur les deux GPU, un engagement de calcul inhabituellement important pour un modèle de vision à l'époque.

Impact et héritage

La marge de victoire d'AlexNet a convaincu une grande partie du domaine de la vision par ordinateur, qui avait été sceptique quant aux approches par réseaux de neurones après les revers du deuxième hiver de l'IA, que la profondeur, l'échelle et le calcul GPU étaient une combinaison gagnante. Les citations de l'article original se comptent par dizaines de milliers, et l'article est fréquemment enseigné comme l'exemple canonique d'un résultat empirique qui a changé le domaine. L'adoption industrielle a suivi rapidement : en deux ans, la plupart des participants au défi ImageNet utilisaient des réseaux convolutifs profonds, et des entreprises comme Google, Facebook et Baidu ont constitué de grandes équipes internes d'apprentissage profond. Le cours de l'action et la stratégie de NVIDIA ont changé dans le sillage d'AlexNet, car les GPU étaient de plus en plus commercialisés pour l'entraînement plutôt que pour le rendu graphique uniquement, une relation qui s'est approfondie au cours de la décennie suivante, alors que les réseaux passaient de huit couches pour AlexNet à des centaines de couches et, plus tard, à l'architecture très différente du transformeur.

AlexNet lui-même a rapidement été supplanté par des réseaux plus profonds tels que VGGNet, GoogLeNet et ResNet lors des concours ImageNet suivants, et les architectures convolutives pour de nombreuses tâches ont depuis été contestées par les transformeurs de vision. Sa signification durable est plus historique que technique : il est généralement cité comme le résultat unique qui a convaincu la communauté plus large de l'apprentissage automatique et de la vision par ordinateur de s'engager dans des méthodes de apprentissage profond à grande échelle, remodelant à la fois les priorités de recherche académique et l'industrie matérielle qui les soutient.

Catégories:deep-learning·computer-vision·history-of-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique