ImageNet 2012 (moment AlexNet)

Traduit de l'anglais

Le défi de reconnaissance visuelle à grande échelle ImageNet 2012 a été remporté de manière décisive par AlexNet, un réseau de neurones convolutif profond dont la chute spectaculaire du taux d'erreur est largement considérée comme l'événement qui a lancé l'ère moderne de l'apprentissage profond.

Le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) de 2012, une compétition annuelle de vision par ordinateur basée sur le jeu de données ImageNet, a été remporté par AlexNet, un réseau neuronal convolutif profond développé par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton à l'Université de Toronto. Ce résultat est largement considéré comme l'événement unique qui a lancé l'ère moderne du apprentissage profond.

La compétition

L'ILSVRC, organisé chaque année depuis 2010, demandait aux participants de classer des images parmi environ 1,2 million de photographies d'entraînement étiquetées d'ImageNet dans l'une des 1 000 catégories d'objets, et était devenu la référence standard pour mesurer les progrès en reconnaissance d'images. Les participations de 2010 et 2011 reposaient principalement sur des méthodes d'extraction de caractéristiques conçues à la main, combinées à des classificateurs classiques d'apprentissage automatique, et les améliorations du taux d'erreur d'une année sur l'autre étaient incrémentales, généralement de quelques points de pourcentage.

Le résultat d'AlexNet

L'entrée de Alex Krizhevsky, entraînée par son équipe à l'aide de deux GPU grand public pendant environ une semaine, a atteint un taux d'erreur top-5 de 15,3 %, une amélioration spectaculaire par rapport aux 26,2 % de la deuxième place, un écart de près de dix points de pourcentage qui a stupéfié la communauté de recherche en vision par ordinateur, dont la plupart n'utilisait pas d'approches par réseaux neuronaux profonds. L'architecture d'AlexNet combinait plusieurs couches convolutives, la fonction d'activation ReLU, la régularisation par abandon (dropout) et l'augmentation de données, des techniques connues individuellement mais jamais combinées à cette échelle et entraînées avec succès sur du matériel GPU, rendu possible en partie par la plateforme CUDA de NVIDIA.

Conséquences et impact

L'ampleur de l'avance d'AlexNet sur les méthodes concurrentes a changé la trajectoire de la recherche en IA en environ deux ans : la recherche en vision par ordinateur s'est presque entièrement tournée vers les approches par réseaux neuronaux, et la combinaison démontrée de grands ensembles de données étiquetées, de calcul GPU et d'architectures profondes est devenue le modèle que les progrès ultérieurs en traitement du langage naturel et dans d'autres domaines suivraient. Les gagnants suivants de l'ILSVRC ont continué à utiliser des réseaux convolutifs profonds avec une profondeur croissante, et d'ici 2015, les taux d'erreur sur le benchmark étaient tombés sous la performance humaine estimée, incitant les organisateurs de la compétition à retirer la piste de classification comme étant effectivement résolue. Le résultat de 2012 est couramment cité, aux côtés des travaux originaux sur la rétropropagation et du document ultérieur Transformer, comme l'un des rares résultats techniques les plus responsables du boom de l'apprentissage profond qui a produit les grands modèles de langage des années 2020, et il a cimenté la réputation de Hinton comme figure centrale du domaine des années avant son prix Nobel de 2024.

Catégories:history-of-ai·deep-learning·computer-vision
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique