Traduit de l'anglais

AlexNet est un réseau de neurones convolutif profond développé en 2012 par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton à l'Université de Toronto. Il a remporté la compétition ImageNet ILSVRC-2012 avec un taux d'erreur top-5 de 15,3 %, déclenchant la révolution de l'apprentissage profond.

AlexNet est une architecture de réseau neuronal convolutif pour la classification d'images, développée en 2012 par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton à l'Université de Toronto. Elle classe les images en 1 000 catégories d'objets et est largement considérée comme la première démonstration à grande échelle de réseaux convolutifs profonds en reconnaissance visuelle. Sa victoire décisive dans le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) 2012 a marqué un tournant dans l'apprentissage automatique, catalysant l'adoption rapide de l'apprentissage profond dans la recherche et l'industrie de l'intelligence artificielle.

Le modèle contient 60 millions de paramètres et 650 000 neurones. Son architecture se compose de huit couches : cinq couches convolutives (certaines suivies d'un max-pooling) et trois couches entièrement connectées. Le réseau utilisait la fonction d'activation ReLU non saturante, ce qui améliorait la vitesse d'entraînement par rapport aux activations traditionnelles tanh et sigmoïde. En raison de contraintes de mémoire, le réseau était divisé sur deux GPU, chaque copie traitant la moitié des neurones. La dernière couche entièrement connectée combinait les sorties des deux GPU.

Architecture

La structure d'AlexNet peut être résumée comme suit : (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linéaire → softmax. Ici, CONV désigne une couche convolutive avec activation ReLU, RN est la normalisation de réponse locale, MP est le max-pooling, FC est une couche entièrement connectée avec ReLU, Linéaire est une couche entièrement connectée sans activation, et DO est l'abandon (dropout). Notamment, les couches convolutives 3, 4 et 5 étaient connectées séquentiellement sans pooling ni normalisation entre elles.

Le réseau utilisait la normalisation de réponse locale et la régularisation par abandon avec une probabilité d'abandon de 0,5 pour réduire le surapprentissage. Tous les poids étaient initialisés comme des distributions gaussiennes avec une moyenne de 0 et un écart type de 0,01. Les biais des couches convolutives 2, 4, 5 et de toutes les couches entièrement connectées étaient initialisés à 1 pour éviter le problème de ReLU mourant.

Entraînement

Le modèle a été entraîné sur l'ensemble d'entraînement ImageNet contenant 1,2 million d'images. L'entraînement a duré 90 époques sur cinq à six jours en utilisant deux GPU Nvidia GTX 580 (3 Go chacun), qui avaient une performance théorique de 1,581 TFLOPS en float32. Chaque passage avant nécessitait environ 1,43 GFLOPs. Les images de l'ensemble de données, stockées au format JPEG, occupaient 27 Go d'espace disque ; le réseau utilisait 2 Go de RAM sur chaque GPU et environ 5 Go de RAM système pendant l'entraînement. Les GPU géraient l'entraînement tandis que les CPU effectuaient le chargement des images et l'augmentation des données.

L'entraînement utilisait la descente de gradient avec momentum avec une taille de lot de 128, un momentum de 0,9 et un décroissance de poids de 0,0005. Le taux d'apprentissage commençait à 10⁻² et était réduit manuellement d'un facteur 10 chaque fois que l'erreur de validation plafonnait, se terminant à 10⁻⁵. Deux formes d'augmentation des données étaient appliquées à la volée sur le CPU, effectivement gratuites : premièrement, les images étaient redimensionnées pour que leur côté le plus court soit de 256 pixels, puis une coupe centrale de 256×256 était prise et normalisée ; deuxièmement, des patchs aléatoires de 224×224 (et leurs réflexions horizontales) étaient extraits de la coupe de 256×256, augmentant la taille de l'ensemble d'entraînement de 2048 fois. De plus, les valeurs RVB de chaque image étaient décalées aléatoirement le long des composantes principales de la distribution des couleurs des pixels.

Compétition ImageNet

L'équipe, nommée SuperVision, a soumis un ensemble de sept AlexNet à la compétition ILSVRC-2012 le 30 septembre 2012. Cinq réseaux utilisaient l'architecture standard, tandis que deux variantes avaient une couche convolutive supplémentaire et étaient pré-entraînés sur la version plus grande ImageNet Fall 2011 (15 millions d'images, 22 000 catégories) avant d'être affinés sur l'ensemble d'entraînement ILSVRC-2012. La prédiction finale était la moyenne des probabilités de tous les sept réseaux. L'ensemble a atteint un taux d'erreur top-5 de 15,3 %, soit plus de 10,8 points de pourcentage de mieux que le deuxième, une amélioration spectaculaire qui a stupéfié la communauté de la vision par ordinateur.

Impact et héritage

Le succès d'AlexNet a démontré la puissance des réseaux convolutifs profonds pour la reconnaissance visuelle à grande échelle, influençant directement des architectures ultérieures telles que le Réseau résiduel et le U-Net. Il a également popularisé l'utilisation des GPU pour l'entraînement de réseaux profonds, une pratique devenue standard dans le domaine. L'accent mis par l'article sur la profondeur et l'efficacité de ReLU, de l'abandon et de l'augmentation des données a façonné la pratique moderne de l'apprentissage profond. AlexNet est souvent cité comme le catalyseur de la révolution de l'apprentissage profond, menant à des percées dans l'IA générative et au développement de grands modèles de langage et de transformeurs. Son influence s'est étendue au-delà du milieu académique, stimulant les investissements dans la recherche en IA dans des entreprises comme OpenAI, Google DeepMind et Anthropic.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·computer-vision·neural-networks·image-classification
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique