Apprentissage profond

Traduit de l'anglais

L'apprentissage profond est un sous-domaine de l'apprentissage automatique qui entraîne des réseaux de neurones à plusieurs couches pour apprendre des représentations hiérarchiques directement à partir de données brutes, alimentant ainsi les systèmes modernes de vision par ordinateur, de parole et de langage.

L'apprentissage profond est une branche de l'apprentissage automatique qui utilise des réseaux de neurones artificiels avec de nombreuses couches empilées pour apprendre des représentations hiérarchiques directement à partir de données brutes, telles que des pixels, des formes d'onde audio ou du texte, sans nécessiter de caractéristiques conçues manuellement. Le mot « profond » fait référence au nombre de couches entre l'entrée et la sortie.

Histoire

Les fondements mathématiques de l'apprentissage profond remontent aux années 1980, lorsque la rétropropagation a été popularisée comme méthode pour entraîner des réseaux multicouches. Les progrès ont stagné dans les années 1990 et 2000 en raison de données limitées, de puissance de calcul limitée et de la concurrence d'autres méthodes statistiques, une période parfois décrite comme faisant partie d'un hiver de l'IA plus large, spécifiquement pour les approches connexionnistes. L'ère moderne du domaine est généralement datée de 2012, lorsque AlexNet, un réseau de neurones convolutif profond entraîné sur des unités de traitement graphique, a remporté le concours ImageNet avec une large marge sur les méthodes basées sur des caractéristiques conçues à la main. Les chercheurs Geoffrey Hinton, Yann LeCun et Yoshua Bengio, plus tard appelés le trio fondateur du domaine, ont reçu le prix Turing 2018 pour avoir posé ses bases ; Hinton et le physicien John Hopfield ont partagé le prix Nobel de physique 2024 pour des travaux fondamentaux connexes.

Architecture

Les premiers succès de l'apprentissage profond provenaient des réseaux convolutifs pour les images et des réseaux de neurones récurrents, y compris la variante LSTM, pour les données séquentielles telles que le texte et la parole. L'introduction en 2017 de l'architecture transformeur, qui traite les séquences en parallèle à l'aide de mécanismes d'attention plutôt que par récurrence étape par étape, a largement remplacé les réseaux récurrents pour les tâches linguistiques et est devenue la base des grands modèles de langage modernes. Les réseaux sont entraînés en minimisant une fonction de perte via des variantes de descente de gradient, avec la rétropropagation utilisée pour calculer comment chaque paramètre doit changer.

Pourquoi cela fonctionne à grande échelle

Les réseaux profonds bénéficient de manière disproportionnée de plus de données et de plus de puissance de calcul par rapport aux méthodes statistiques antérieures, une relation formalisée plus tard sous le nom de lois de mise à l'échelle. Ce comportement de mise à l'échelle, combiné à la capacité de traitement parallèle du matériel GPU initialement conçu pour le rendu graphique, a permis aux praticiens d'entraîner des modèles toujours plus grands au cours des années 2010 et 2020. La domination de Nvidia dans les GPU adaptés à l'IA et sa plateforme logicielle CUDA sont ainsi devenues une pièce centrale de l'infrastructure industrielle.

Impact et critiques

L'apprentissage profond a stimulé des progrès rapides en vision par ordinateur, en reconnaissance vocale, en traduction automatique et, de manière la plus visible pour le public, en génération de texte et d'images. Les critiques notent que les réseaux profonds restent largement opaques, fonctionnent comme des correspondances statistiques de motifs dont les échecs peuvent être difficiles à prédire, et nécessitent d'énormes ressources énergétiques et de données, soulevant des préoccupations environnementales et de droit d'auteur. Les partisans rétorquent que la même recette de mise à l'échelle a produit à plusieurs reprises des capacités qui n'avaient pas été explicitement conçues, un schéma central aux débats en cours sur la trajectoire du domaine vers une intelligence plus générale.

Catégories:deep-learning·fundamentals
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique