Réseau de croyances profondes

Traduit de l'anglais

Un réseau de croyances profondes (DBN) est un modèle graphique génératif composé de machines de Boltzmann restreintes empilées, permettant un apprentissage non supervisé couche par couche et servant d'architecture fondamentale de l'apprentissage profond.

Un réseau de croyances profondes (DBN) est un modèle graphique génératif, ou alternativement une classe de réseau de neurones profonds, composé de plusieurs couches de variables latentes (« unités cachées »), avec des connexions entre les couches mais pas entre les unités d'une même couche. Lorsqu'il est entraîné sans supervision sur un ensemble d'exemples, un DBN peut apprendre à reconstruire probabilistiquement ses entrées, les couches agissant comme des détecteurs de caractéristiques. Après cette phase d'apprentissage, un DBN peut être affiné de manière supervisée pour des tâches de classification.

Les DBN peuvent être vus comme une composition de réseaux simples et non supervisés, tels que les machines de Boltzmann restreintes (RBM) ou les autoencodeurs, où la couche cachée de chaque sous-réseau sert de couche visible pour le suivant. Une RBM est un modèle génératif non dirigé basé sur l'énergie, avec une couche visible et une couche cachée, et des connexions entre les couches mais pas au sein de celles-ci. Cette composition permet une procédure d'entraînement non supervisée, rapide et par couches, où la divergence contrastive est appliquée à chaque sous-réseau successivement, en commençant par la paire de couches la plus basse (dont la couche visible est l'ensemble d'entraînement).

La découverte que les DBN peuvent être entraînés de manière gloutonne, couche par couche, a conduit à l'un des premiers algorithmes efficaces d'apprentissage profond. En général, il existe de nombreuses implémentations et utilisations attrayantes des DBN dans des applications réelles, comme l'électroencéphalographie et la découverte de médicaments.

Contexte historique

Les réseaux de croyances profondes sont apparus au milieu des années 2000 comme une percée pour l'entraînement d'architectures profondes. Avant leur introduction, l'entraînement de réseaux de neurones multicouches était notoirement difficile en raison de problèmes comme le gradient qui disparaît et la lente convergence. La stratégie de pré-entraînement glouton par couches introduite avec les DBN a fourni un moyen pratique d'initialiser les réseaux profonds, qui pouvaient ensuite être affinés pour des tâches supervisées. Ce travail, principalement associé à Geoffrey Hinton et ses collègues de l'University of Toronto, a revitalisé l'deep learning et a jeté les bases d'avancées ultérieures dans les réseaux de neurones.

Le développement des DBN est souvent cité comme une étape clé dans l'histoire de l'intelligence artificielle, faisant le pont entre les travaux antérieurs sur les modèles probabilistes et l'apprentissage automatique et l'apprentissage profond moderne. Le succès des DBN dans des tâches comme la reconnaissance de chiffres manuscrits et la classification de documents a démontré la puissance de l'apprentissage hiérarchique de caractéristiques, influençant des modèles ultérieurs tels que les autoencodeurs profonds et les réseaux de neurones convolutifs.

Entraînement avec la divergence contrastive

La méthode d'entraînement des RBM, proposée par Geoffrey Hinton pour les modèles de « produits d'experts », est appelée divergence contrastive (CD). La CD fournit une approximation de la méthode du maximum de vraisemblance qui serait idéalement utilisée pour apprendre les poids. Lors de l'entraînement d'une RBM, la mise à jour des poids s'effectue par descente de gradient selon l'équation :

w_ij(t+1) = w_ij(t) + η * ∂log(p(v))/∂w_ij

où p(v) est la probabilité d'un vecteur visible, donnée par p(v) = (1/Z) * Σ_h e^(-E(v,h)), avec Z la fonction de partition pour la normalisation et E(v,h) la fonction d'énergie assignée à l'état du réseau. Une énergie plus faible indique une configuration plus « souhaitable ». Le gradient ∂log(p(v))/∂w_ij a la forme simple ⟨v_i h_j⟩_data - ⟨v_i h_j⟩_model, où ⟨...⟩_p représente les moyennes par rapport à la distribution p.

La difficulté réside dans l'échantillonnage de ⟨v_i h_j⟩_model car il nécessite un échantillonnage de Gibbs alterné prolongé. La CD remplace cette étape en exécutant un échantillonnage de Gibbs alterné sur n étapes (des valeurs de n=1 fonctionnent bien). Après ces n étapes, les données sont échantillonnées et cet échantillon est utilisé à la place de ⟨v_i h_j⟩_model. La procédure CD fonctionne comme suit :

  1. Initialiser les unités visibles avec un vecteur d'entraînement.
  2. Mettre à jour les unités cachées en parallèle étant donné les unités visibles : p(h_j=1|V) = σ(b_j + Σ_i v_i w_ij), où σ est la fonction sigmoïde et b_j le biais de l'unité cachée j.
  3. Reconstruire les unités visibles à partir des unités cachées, puis mettre à jour à nouveau les unités cachées en fonction de cette reconstruction.
  4. Effectuer la mise à jour des poids en utilisant la différence entre les corrélations originales et reconstruites.

Cette procédure est appliquée de manière gloutonne, couche par couche, pour entraîner un DBN. Après le pré-entraînement, l'ensemble du réseau peut être affiné par rétropropagation ou d'autres méthodes supervisées.

Applications et impact

Les réseaux de croyances profondes ont été appliqués dans divers domaines. Dans le secteur de la santé, ils ont été utilisés pour analyser les signaux d'électroencéphalographie (EEG), aidant à la détection de conditions neurologiques. Dans la découverte de médicaments, ils ont été employés pour prédire les propriétés moléculaires et identifier des candidats médicaments potentiels, en tirant parti de leur capacité à apprendre des représentations hiérarchiques à partir de données chimiques.

Les DBN ont également trouvé des applications en reconnaissance vocale, où ils ont servi de modèles acoustiques, et en reconnaissance d'images, où ils ont appris des caractéristiques à partir de pixels bruts. Leur succès dans ces domaines a démontré la polyvalence du pré-entraînement génératif, influençant les développements ultérieurs dans l'IA générative et les modèles à grande échelle.

Limites et évolution

Les DBN présentent plusieurs limites. L'entraînement peut être coûteux en calcul, surtout pour de grands ensembles de données, et l'approximation par divergence contrastive peut conduire à des estimations biaisées. De plus, en tant que modèles génératifs, ils sont moins évolutifs que les modèles discriminants pour certaines tâches. L'essor des modèles basés sur les transformeurs, en particulier dans le traitement du langage naturel, a détourné l'attention des DBN, car ces nouvelles architectures offraient de meilleures performances avec un entraînement de bout en bout.

Néanmoins, les principes sous-jacents aux DBN - tels que le pré-entraînement par couches et la modélisation basée sur l'énergie - continuent d'influencer la recherche contemporaine. Des concepts comme les autoencodeurs et les autoencodeurs variationnels s'appuient sur des idées similaires, et la stratégie de pré-entraînement glouton a été adaptée sous diverses formes dans les pipelines d'apprentissage profond modernes.

Héritage et lectures complémentaires

Les réseaux de croyances profondes représentent un moment charnière dans l'évolution de l'intelligence artificielle. Ils ont démontré que des architectures profondes pouvaient être entraînées efficacement, ouvrant la voie à la révolution de l'apprentissage profond. Des chercheurs d'institutions comme le CSAIL du MIT, le Stanford AI Lab et Berkeley AI Research ont bâti sur ces fondations, contribuant aux progrès rapides du domaine.

Pour ceux qui souhaitent approfondir les DBN, les articles originaux de Hinton et de ses collaborateurs fournissent des dérivations détaillées et des résultats expérimentaux. Les manuels sur l'apprentissage profond incluent souvent des chapitres consacrés aux DBN et aux RBM, offrant à la fois des perspectives théoriques et pratiques. Alors que le domaine continue d'évoluer, les leçons tirées des DBN restent pertinentes, en particulier dans les domaines de l'apprentissage non supervisé et de la modélisation générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·generative-model·neural-network·machine-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique