Traduit de l'anglais

Les modèles de diffusion latente (LDM) sont une architecture de modèle de diffusion qui effectue le débruitage dans un espace latent compressé, permettant une génération d'images haute résolution efficace. Développés par le groupe CompVis de l'Université Louis-et-Maximilien de Munich, les LDM sous-tendent les versions 1.1 à 2.1 de Stable Diffusion.

Le modèle de diffusion latent (LDM) est une architecture de modèle de diffusion développée par le groupe Computer Vision & Learning (CompVis) de l'Université Louis-et-Maximilien de Munich. Il améliore les modèles de diffusion standard en effectuant le processus de diffusion dans un espace latent de dimension inférieure plutôt que directement dans l'espace des pixels, ce qui réduit le coût de calcul et permet une génération plus efficace d'images haute résolution. Les LDM intègrent également un conditionnement par auto-attention et attention croisée, permettant un contrôle flexible de la sortie générée en fonction de texte, d'images ou d'autres modalités.

Les modèles de diffusion ont été introduits en 2015 comme une classe de modèles génératifs qui apprennent à inverser un processus progressif d'ajout de bruit. L'architecture LDM a été publiée sur arXiv le 20 décembre 2021, et les référentiels Stable Diffusion et LDM ont été publiés sur GitHub. Les LDM sont largement utilisés dans les modèles de diffusion pratiques ; par exemple, les versions 1.1 à 2.1 de Stable Diffusion étaient basées sur l'architecture LDM.

Architecture

Le LDM se compose de trois composants principaux : un autoencodeur variationnel (VAE), un U-Net modifié et un encodeur de texte. L'encodeur du VAE compresse une image d'entrée de l'espace des pixels vers un espace latent plus petit, capturant la signification sémantique tout en réduisant la dimensionnalité. Un bruit gaussien est appliqué de manière itérative à cette représentation latente compressée pendant la diffusion directe. Le U-Net, construit sur un backbone ResNet, débruite la représentation latente par un processus inverse. Enfin, le décodeur du VAE convertit le latent débruité en espace de pixels pour produire l'image finale.

L'étape de débruitage peut être conditionnée par du texte, des images ou d'autres modalités. Pour le conditionnement par texte, un encodeur de texte CLIP ViT-L/14 pré-entraîné transforme les invites textuelles en un espace d'embedding, qui est ensuite exposé au U-Net via un mécanisme d'attention croisée. Cela permet au modèle de générer des images qui correspondent à la description textuelle fournie.

Autoencodeur variationnel

Le VAE est d'abord entraîné sur un ensemble de données d'images. Son encodeur prend une image en entrée et produit une représentation latente de dimension inférieure, qui sert d'entrée au U-Net. Après l'entraînement, l'encodeur est utilisé pour compresser les images, et le décodeur reconstruit les images à partir des représentations latentes.

Dans la version implémentée, l'encodeur est un réseau neuronal convolutif (CNN) avec un seul mécanisme d'auto-attention près de la fin. Il prend un tenseur de forme (3, H, W) et produit un tenseur de forme (8, H/8, W/8), qui concatène la moyenne et la variance prédites du vecteur latent, chacune de forme (4, H/8, W/8). Pendant l'entraînement, la variance est utilisée, mais à l'inférence, seule la moyenne est généralement conservée. Le décodeur est également un CNN avec un seul mécanisme d'auto-attention, mappant un tenseur (4, H/8, W/8) vers (3, H, W).

U-Net

Le backbone U-Net traite plusieurs entrées : un tableau d'images latentes provenant de l'encodeur du VAE, un embedding de pas de temps indiquant le niveau de bruit actuel, et des embeddings de conditionnement provenant de l'encodeur de texte. Le U-Net est entraîné à prédire le bruit qui a été ajouté à la représentation latente, lui permettant de débruiter de manière itérative. L'architecture intègre des blocs résiduels et des couches d'attention, lui permettant de gérer à la fois le contexte local et global.

Entraînement et conditionnement

Les LDM sont entraînés avec un objectif de débruitage : étant donné un latent bruité, le modèle apprend à prédire le bruit d'origine. Le processus d'entraînement utilise une fonction de perte qui mesure la différence entre le bruit prédit et le bruit réel. Le conditionnement est intégré par des couches d'attention croisée, où l'embedding de texte est utilisé pour moduler le processus de débruitage. Cette approche prend en charge le guidage sans classifieur, où le modèle est entraîné à la fois avec et sans conditionnement, et à l'inférence, le conditionnement est amplifié pour améliorer l'adhérence à l'invite.

Applications et impact

Les LDM sont devenus une architecture fondamentale pour la génération de texte à image. Stable Diffusion, un modèle open-source de premier plan, utilise l'architecture LDM. Les versions 1.1 à 1.4 ont été publiées par CompVis en août 2022, chaque version étant affinée sur des images de plus en plus esthétiques. Stable Diffusion 1.5, publié par RunwayML en octobre 2022, a intégré un abandon de 10 % du conditionnement de texte pour améliorer le guidage sans classifieur. L'efficacité de la diffusion dans l'espace latent a permis d'exécuter ces modèles sur du matériel grand public, démocratisant l'accès à l'IA générative.

Développements connexes

Les modèles de diffusion ont évolué à partir de travaux antérieurs sur la thermodynamique hors équilibre. Un article de 2019 a introduit le réseau de scores conditionnel au bruit (NCSN), également connu sous le nom d'appariement de scores avec dynamique de Langevin (SMLD), avec une implémentation PyTorch. Un article de 2020 a proposé le modèle probabiliste de diffusion par débruitage (DDPM), qui a amélioré l'entraînement via l'inférence variationnelle et a été publié en TensorFlow. Le LDM s'appuie sur ces fondations en déplaçant le processus de diffusion vers un espace latent, une innovation clé qui réduit les besoins en mémoire et en calcul tout en maintenant une qualité de sortie élevée.

Les LDM font partie du domaine plus large de l'IA générative, qui comprend également les grands modèles de langage et d'autres architectures de apprentissage profond. L'utilisation de l'attention croisée et des backbones U-Net relie les LDM aux avancées dans la conception de réseaux neuronaux. En 2025, la diffusion latente reste une approche standard dans les systèmes de génération d'images commerciaux et open-source, avec des recherches en cours axées sur l'amélioration de l'efficacité, de la contrôlabilité et de la fidélité.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·diffusion-models·deep-learning·image-generation
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique