Traduit de l'anglais

Un réseau de neurones est un modèle computationnel composé de couches interconnectées d'unités simples dont les connexions pondérées sont apprises par entraînement, formant la structure de base derrière l'apprentissage profond et les systèmes d'IA modernes.

Un réseau de neurones est un modèle computationnel composé de couches interconnectées d'unités de traitement simples, vaguement inspirées des neurones biologiques, dont les forces de connexion, ou poids, sont ajustées par l'entraînement pour approximer une fonction souhaitée. Les réseaux de neurones constituent la structure computationnelle centrale derrière l'apprentissage profond moderne et, par extension, la plupart des systèmes contemporains d'intelligence artificielle.

Histoire

Le premier modèle neuronal entraînable était le perceptron, introduit en 1958, qui pouvait apprendre à classer des motifs simples en utilisant une seule couche de poids ajustables. Ses limitations, documentées dans une critique de 1969, ont contribué à une perte plus large de financement de la recherche, connue sous le nom d'hiver de l'IA. L'intérêt pour les réseaux multicouches a repris dans les années 1980 avec la popularisation de la rétropropagation, un algorithme permettant de calculer efficacement comment chaque poids d'un réseau devrait changer pour réduire l'erreur, ce qui a permis d'entraîner en pratique des réseaux avec des couches cachées. Les réseaux de neurones sont passés d'une technique de niche à l'approche dominante en IA après le succès de AlexNet en 2012, qui a démontré que des réseaux avec de nombreuses couches, entraînés sur de grands ensembles de données à l'aide d'unités de traitement graphique, pouvaient surpasser nettement les méthodes précédentes sur des tâches du monde réel.

Structure

Un réseau de neurones est organisé en couches d'unités, ou neurones, chacune calculant une somme pondérée de ses entrées et faisant passer le résultat à travers une fonction d'activation non linéaire avant de l'envoyer à la couche suivante. Les réseaux avec de nombreuses couches de ce type entre l'entrée et la sortie sont décrits comme "profonds", donnant son nom à l'apprentissage profond. Pendant l'entraînement, une fonction de perte mesure l'écart entre la sortie du réseau et le résultat souhaité, et le descente de gradient ajuste itérativement les poids pour réduire cet écart, la rétropropagation fournissant efficacement les gradients nécessaires à travers toutes les couches à la fois.

Familles architecturales

Différentes architectures de réseaux conviennent à différents types de données. Les réseaux de neurones convolutifs utilisent des filtres partagés et spatialement locaux et sont bien adaptés aux images. Les réseaux de neurones récurrents, y compris la variante LSTM, traitent les séquences étape par étape et étaient historiquement utilisés pour le texte et la parole avant d'être supplantés par l'architecture transformeur, qui traite des séquences entières en parallèle à l'aide de l'attention. Les architectures génératives telles que le réseau antagoniste génératif et le modèle de diffusion appliquent les réseaux de neurones à la tâche de produire de nouvelles données plutôt que de seulement classer ou prédire.

Limitations et interprétabilité

Les réseaux de neurones sont souvent critiqués comme des "boîtes noires" : leurs représentations internes sont difficiles à inspecter ou à expliquer pour les humains, même lorsque leurs sorties sont précises. Cela a motivé un sous-domaine de recherche parfois appelé interprétabilité, qui tente de rétro-ingénierie ce que représentent les composants individuels d'un réseau entraîné. Malgré cette opacité, les réseaux de neurones restent l'outil dominant dans la vision, le langage, l'audio, et de plus en plus dans la robotique et les applications scientifiques, principalement parce que leurs performances continuent de s'améliorer de manière prévisible avec plus de données, plus de paramètres et plus de calcul.

Catégories:deep-learning·fundamentals
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique