Alex Krizhevsky est un informaticien canadien surtout connu pour ses travaux sur les réseaux de neurones artificiels et l'apprentissage profond. En 2012, Krizhevsky, Ilya Sutskever et leur directeur de thèse Geoffrey Hinton, à l'Université de Toronto, ont développé un puissant réseau de reconnaissance visuelle appelé AlexNet en utilisant seulement deux cartes GPU de la marque GeForce. Cela a révolutionné la recherche sur les réseaux de neurones, car auparavant, ceux-ci étaient entraînés sur des CPU. La transition vers les GPU a ouvert la voie au développement de modèles d'IA avancés.
Krizhevsky est également le principal auteur des ensembles de données CIFAR-10 et CIFAR-100, des références largement utilisées en apprentissage automatique et en vision par ordinateur. Ses nombreux articles sur ces sujets sont fréquemment cités par d'autres chercheurs.
Développement d'AlexNet
Motivé par Sutskever et inspiré par Hinton, Krizhevsky a développé AlexNet pour repousser les limites de la reconnaissance et de la classification d'images. S'appuyant sur les réseaux de neurones convolutifs et sur l'approche de Sutskever consistant à approfondir les couches neuronales bien au-delà des conventions de l'époque - ainsi que sur l'ajout de Dropout pour la robustesse de l'entraînement - AlexNet a remporté le défi ImageNet en 2012. L'équipe a présenté son article sur AlexNet à NeurIPS (NIPS) 2012.
L'architecture du réseau intégrait plusieurs innovations qui sont devenues des standards dans les modèles d'apprentissage profond ultérieurs. Il utilisait des unités linéaires rectifiées (ReLU) pour un entraînement plus rapide, un pooling avec chevauchement pour réduire le surapprentissage, et des techniques d'augmentation de données pour accroître la taille effective de l'ensemble d'entraînement. L'utilisation de deux GPU a permis d'entraîner le modèle à une échelle auparavant impraticable avec des CPU seuls.
Transition vers l'industrie
Peu après les débuts d'AlexNet, Krizhevsky et Sutskever ont vendu leur startup, DNN Research Inc., à Google. Chez Google, Krizhevsky a continué à travailler sur des applications d'apprentissage profond, contribuant à des projets qui influenceraient plus tard le développement de systèmes d'IA à grande échelle. Il a quitté Google en septembre 2017 après avoir perdu intérêt pour ce travail, pour rejoindre l'entreprise Dessa afin de soutenir de nouvelles techniques d'apprentissage profond.
Son passage à l'industrie reflétait une tendance plus large au milieu des années 2010, alors que les chercheurs universitaires en apprentissage profond rejoignaient de plus en plus les entreprises technologiques pour appliquer leurs découvertes à des produits réels. Cette période a vu une commercialisation rapide de la recherche sur les réseaux de neurones, avec des applications allant de la reconnaissance d'images au traitement du langage naturel.
Héritage et impact
AlexNet est largement crédité d'avoir déclenché la révolution de l'apprentissage profond. Son succès a démontré l'efficacité des réseaux de neurones profonds entraînés sur GPU, conduisant à des progrès rapides dans de multiples domaines de l'intelligence artificielle au-delà de la vision par ordinateur. Les techniques et l'élan générés par AlexNet ont contribué à façonner le développement des modèles modernes de traitement du langage naturel, y compris les modèles basés sur les transformeurs à grande échelle tels que BERT et GPT, qui alimentent des outils comme ChatGPT.
Le passage à l'entraînement sur GPU, que AlexNet a inauguré, est devenu une pratique fondamentale dans le domaine. Les avancées ultérieures, telles que la normalisation par lots et les réseaux résiduels, se sont directement appuyées sur les fondations posées par Krizhevsky et ses collègues. Les ensembles de données CIFAR qu'il a créés restent des références standard pour évaluer de nouveaux algorithmes de classification d'images.
Contributions à la recherche
Au-delà d'AlexNet, les travaux de Krizhevsky sur les techniques d'augmentation de données et d'initialisation des poids ont influencé la manière dont les réseaux de neurones sont entraînés. Ses articles sur ces sujets figurent parmi les plus cités dans le domaine, fournissant des conseils pratiques aux chercheurs et aux praticiens. Les ensembles de données CIFAR-10 et CIFAR-100, qu'il a créés, contiennent des images étiquetées dans plusieurs catégories et sont utilisés pour tester les performances des modèles de classification.
L'approche de Krizhevsky, qui combinait pragmatisme d'ingénierie et perspicacité théorique, a contribué à combler le fossé entre la recherche académique et le déploiement pratique. Ses contributions continuent d'être référencées dans la littérature moderne sur le apprentissage automatique, et son travail à l'Université de Toronto reste une étape marquante dans l'histoire du développement de l'IA.