Traduit de l'anglais

Les modèles de diffusion probabilistes à débruitage (DDPM) sont une classe de modèles génératifs qui apprennent à inverser un processus de bruitage progressif pour créer des données, largement utilisés pour la génération d'images. Introduits en 2020, ils ont amélioré les méthodes de diffusion antérieures grâce à l'inférence variationnelle.

Les modèles de diffusion par débruitage (DDPM) sont une classe de modèles génératifs en apprentissage automatique qui génèrent des données en apprenant à inverser un processus de bruitage progressif. Ils appartiennent à la famille plus large des modèles de diffusion, qui modélisent les données comme subissant une marche aléatoire avec dérive dans un espace de haute dimension. Les DDPM ont été introduits dans un article de 2020 qui améliorait les approches de diffusion antérieures utilisant l'inférence variationnelle, et ils sont devenus une base pour de nombreux systèmes modernes de génération d'images.

Dans un DDPM, le processus direct ajoute un bruit gaussien à une image sur une séquence de pas de temps, la transformant progressivement en bruit pur. Le modèle est entraîné à inverser ce processus, en partant d'un bruit aléatoire et en débruitant de manière itérative pour produire une image réaliste. Cette approche s'est révélée très efficace pour des tâches telles que la génération d'images, l'inpainting et la super-résolution, et elle sous-tend des systèmes commerciaux comme Stable Diffusion et DALL-E.

Mécanisme de base

Le cadre DDPM définit un processus de diffusion directe avec un calendrier fixe de niveaux de bruit. Pour une image donnée, du bruit est ajouté à chaque pas de temps selon un calendrier de variance, produisant une séquence de versions de plus en plus bruitées. Le processus inverse est appris par un réseau de neurones, généralement un U-Net ou un transformer, qui prédit la composante de bruit à chaque étape. L'entraînement minimise une erreur quadratique moyenne simple entre le bruit prédit et le bruit réel, ce qui équivaut à une forme d'inférence variationnelle.

Mathématiquement, le processus direct utilise des constantes \(\beta_1, \dots, \beta_T\) dans (0,1), avec \(\alpha_t = 1 - \beta_t\) et \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\). L'image bruitée au pas de temps \(t\) est une combinaison linéaire de l'image originale et du bruit gaussien, avec une variance \(\sigma_t^2 = 1 - \bar{\alpha}_t\). Le processus inverse est paramétré par un réseau de neurones qui produit la moyenne de la distribution de débruitage.

Entraînement et échantillonnage

L'entraînement d'un DDPM consiste à échantillonner un pas de temps aléatoire, à ajouter le bruit correspondant à une image, et à entraîner le réseau à prédire ce bruit. La fonction de perte est \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\), où \(\epsilon\) est le bruit et \(\epsilon_\theta\) est la prédiction du réseau. Cet objectif est dérivé d'une borne variationnelle sur la log-vraisemblance.

Au moment de l'échantillonnage, le modèle part d'un bruit gaussien pur et applique le processus inverse de manière itérative pendant \(T\) étapes, en supprimant à chaque fois une partie du bruit. Le nombre d'étapes peut être réduit en utilisant des techniques comme les modèles implicites de diffusion par débruitage (DDIM) ou en apprenant un calendrier de bruit, permettant une génération plus rapide.

Contexte historique

Les modèles de diffusion ont été proposés pour la première fois en 2015 par des chercheurs dont Jascha Sohl-Dickstein et ses collègues, en utilisant des principes de la thermodynamique hors équilibre. Ils ont montré qu'une distribution de données complexe pouvait être progressivement diffusée en une distribution gaussienne simple, et que l'apprentissage de l'inversion de ce processus pouvait générer de nouveaux échantillons. Cependant, les premières méthodes étaient coûteuses en calcul et moins efficaces que les GAN à l'époque.

L'article DDPM de 2020, écrit par Jonathan Ho, Ajay Jain et Pieter Abbeel, a démontré qu'avec un calendrier de bruit soigneusement choisi et un backbone U-Net, les modèles de diffusion pouvaient atteindre une qualité de génération d'images de pointe. Cela a déclenché une expansion rapide de la recherche et des applications.

Applications et impact

En 2024, les DDPM et leurs variantes sont largement utilisés en vision par ordinateur pour des tâches telles que le débruitage d'images, l'inpainting, la super-résolution et la génération texte-image. Ils sont également appliqués en traitement du langage naturel pour la génération de texte et le résumé, ainsi qu'en génération audio. Des produits commerciaux comme Stable Diffusion et DALL-E combinent les DDPM avec des encodeurs de texte et des modules d'attention croisée pour permettre la génération conditionnée par le texte, les rendant accessibles à un large public.

Les DDPM ont également influencé d'autres domaines, notamment l'apprentissage par renforcement et la simulation scientifique, où ils sont utilisés pour modéliser des distributions complexes. Leur capacité à générer des échantillons de haute qualité en a fait une pierre angulaire de la recherche moderne en intelligence artificielle.

Limites et directions futures

Malgré leur succès, les DDPM présentent des limites. L'échantillonnage est généralement plus lent que celui des GAN en raison du processus de débruitage itératif, bien que des méthodes accélérées aient été développées. Ils nécessitent également des ressources de calcul substantielles pour l'entraînement, ce qui a suscité un intérêt pour des architectures efficaces comme AWS Trainium et des TPU de Google Cloud. La recherche en cours se concentre sur l'amélioration de la qualité des échantillons, la réduction du temps d'inférence et l'extension des DDPM à de nouvelles modalités.

En 2025, les modèles de diffusion restent un domaine d'étude actif, avec des innovations dans les architectures de base, les calendriers de bruit et les mécanismes de conditionnement qui continuent de repousser les limites de la modélisation générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·machine-learning·computer-vision·deep-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique