Algorithme de Hebbian généralisé

Traduit de l'anglais

L'algorithme de Hebb généralisé (GHA) est une règle d'apprentissage non supervisée pour les réseaux de neurones, utilisée pour l'analyse en composantes principales, étendant la règle d'Oja afin d'extraire séquentiellement plusieurs composantes principales. Il met à jour les poids en se basant sur la plasticité hébbienne avec une orthogonalisation de type Gram-Schmidt.

L’algorithme de Hebb généralisé (GHA) est une règle d’apprentissage non supervisé pour les réseaux de neurones artificiels qui effectue une analyse en composantes principales (ACP). Il a été introduit par Terence D. Sanger en 1989 comme une extension de la règle d’Oja, qui n’extrait que la première composante principale. Le GHA permet à un réseau de neurones linéaire à une seule couche d’apprendre les k premières composantes principales de la distribution des données d’entrée de manière séquentielle, ce qui en fait une méthode fondatrice dans la réduction de dimensionnalité et l’extraction de caractéristiques basées sur les réseaux de neurones.

Contrairement aux méthodes d’apprentissage supervisé qui nécessitent des données étiquetées, le GHA fonctionne uniquement sur les statistiques d’entrée. Il suit une règle de mise à jour inspirée de Hebb, où les poids synaptiques sont renforcés lorsque les activations pré- et post-synaptiques sont corrélées, mais avec une étape cruciale de normalisation et de décorrélation. Cette décorrélation, implémentée via un processus de type Gram-Schmidt, garantit que chaque neurone de sortie apprend une composante principale distincte, ordonnée par variance décroissante.

Formulation mathématique

Pour un vecteur d’entrée x ∈ ℝⁿ et un vecteur de sortie y ∈ ℝᵏ, le réseau calcule y = W x, où W est une matrice de poids k×n. La règle de mise à jour du GHA pour chaque poids wᵢⱼ (connectant l’entrée j à la sortie i) est :

Δwᵢⱼ = η yᵢ ( xⱼ - Σ_{p=1}^{i} wₚⱼ yₚ )

Ici, η est le taux d’apprentissage, et la somme sur p de 1 à i effectue une orthogonalisation séquentielle. Pour le premier neurone de sortie (i=1), la règle se réduit à la règle d’Oja : Δw₁ⱼ = η y₁ (xⱼ - w₁ⱼ y₁). Pour les neurones suivants, le terme soustrait les projections de l’entrée sur les vecteurs de poids déjà appris, forçant le nouveau neurone à capturer une variance orthogonale aux composantes précédentes.

Cette mise à jour peut être interprétée comme une ascension de gradient stochastique sur la variance expliquée par chaque sortie, sous contraintes d’orthonormalité. Sous des conditions modérées sur le taux d’apprentissage (par exemple, décroissant vers zéro), les vecteurs de poids convergent vers les vecteurs propres de la matrice de covariance de l’entrée, ordonnés par valeur propre décroissante.

Relation avec la règle d’Oja et l’ACP

La règle d’Oja, proposée par Erkki Oja en 1982, est une règle de Hebb à un seul neurone qui normalise le vecteur de poids à une longueur unitaire, ce qui le fait converger vers la première composante principale. Le GHA généralise cela en utilisant une cascade de neurones, où la mise à jour de chaque neurone inclut une soustraction des contributions de tous les neurones précédents. Cela est analogue à la procédure d’orthogonalisation de Gram-Schmidt, mais effectuée en ligne et de manière stochastique.

Comparé aux algorithmes d’ACP par lots (par exemple, la décomposition en valeurs propres), le GHA est entièrement incrémental et peut traiter des flux de données un échantillon à la fois. Il ne nécessite pas de stocker la matrice de covariance complète, ce qui le rend efficace en mémoire pour les données de haute dimension. Cependant, il converge plus lentement que les méthodes par lots et est sensible au calendrier du taux d’apprentissage.

Applications et importance

Le GHA a été appliqué dans divers domaines, notamment la compression d’images, le traitement du signal et la reconnaissance de formes. Dans les années 1990, il a été utilisé pour l’extraction de caractéristiques dans la reconnaissance de chiffres manuscrits et pour réduire la dimensionnalité dans les données radar et sonar. Sa nature en ligne le rendait attrayant pour les systèmes en temps réel, tels que les filtres adaptatifs et la robotique.

Dans le contexte de la recherche en Machine learning et Neural network, le GHA a contribué à la compréhension théorique de l’apprentissage de Hebb et de l’auto-organisation. Il a démontré que des règles d’apprentissage locales simples pouvaient atteindre des propriétés statistiques globales, un thème qui a influencé les travaux ultérieurs sur le Deep learning et l’apprentissage de représentations non supervisé. Bien que les réseaux profonds modernes utilisent souvent la rétropropagation et l’Adam (Optimizer), le GHA reste un exemple classique d’apprentissage biologiquement plausible.

Limites et contexte moderne

Le GHA suppose un réseau linéaire et des statistiques d’entrée de type gaussien, ce qui limite sa capacité à capturer des structures non linéaires. Des extensions telles que l’ACP non linéaire et les méthodes à noyau abordent ce problème, mais elles perdent la forme de Hebb simple. De plus, le GHA nécessite un réglage minutieux du taux d’apprentissage ; un taux trop élevé conduit à une divergence, un taux trop faible ralentit la convergence. La nature séquentielle implique également que les erreurs dans les premières composantes se propagent aux suivantes.

Avec l’essor du Deep learning et des architectures Transformer (architecture), le GHA est rarement utilisé dans les systèmes de pointe. Cependant, il reste une pierre angulaire pédagogique dans les cours sur le calcul neuronal et l’Artificial intelligence. Ses principes de décorrélation et de maximisation de la variance sous-tendent des techniques plus avancées comme le Batch Normalization et le Layer Normalization, qui visent également à stabiliser et décorréler les activations.

Voir aussi

Références

  • Sanger, T. D. (1989). « Optimal unsupervised learning in a single-layer linear feedforward neural network. » Neural Networks, 2(6), 459-473.
  • Oja, E. (1982). « Simplified neuron model as a principal component analyzer. » Journal of Mathematical Biology, 15(3), 267-273.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:unsupervised-learning·neural-network·principal-component-analysis·hebbian-learning
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique