Stable Diffusion est un modèle d'apprentissage profond de type texte-vers-image, publié en 2022 par Stability AI, basé sur des techniques de diffusion. Il est principalement utilisé pour générer des images détaillées conditionnées par des descriptions textuelles, bien qu'il puisse également être appliqué à des tâches telles que l'inpainting, l'outpainting et les traductions image-vers-image guidées par une invite textuelle. Le modèle est considéré comme faisant partie de la vague en cours de l'IA générative et a marqué une rupture avec les précédents modèles texte-vers-image propriétaires comme DALL-E et Midjourney, qui n'étaient accessibles que via des services cloud.
Stable Diffusion est un modèle de diffusion latent, une sorte de réseau neuronal artificiel génératif profond. Son code et ses poids de modèle ont été publiés publiquement, et une version optimisée peut fonctionner sur la plupart des matériels grand public équipés d'un GPU modeste avec aussi peu que 2,4 Go de VRAM. Cette accessibilité l'a distingué des modèles antérieurs et a contribué à son adoption généralisée.
Développement
Stable Diffusion est issu d'un projet appelé diffusion latente, développé en Allemagne par des chercheurs de l'Université Louis-et-Maximilien de Munich et de l'Université de Heidelberg. Quatre des cinq auteurs originaux - Robin Rombach, Andreas Blattmann, Patrick Esser et Dominik Lorenz - ont ensuite rejoint Stability AI et publié des versions ultérieures du modèle. La licence technique a été publiée par le groupe CompVis de l'Université Louis-et-Maximilien de Munich, avec un développement dirigé par Patrick Esser de Runway et Robin Rombach de CompVis, qui avaient précédemment inventé l'architecture de diffusion latente. Stability AI a également crédité EleutherAI et LAION, une organisation allemande à but non lucratif qui a assemblé l'ensemble de données d'entraînement, comme soutiens.
Technologie
Architecture
Les modèles de diffusion, introduits en 2015, sont entraînés à supprimer les applications successives de bruit gaussien sur les images d'entraînement, à la manière d'une séquence d'autoencodeurs de débruitage. Le nom dérive de la diffusion thermodynamique, car le développement initial a été inspiré par la thermodynamique. Les modèles de la série Stable Diffusion antérieurs à SD 3 utilisaient une variante appelée modèle de diffusion latent (LDM), développée en 2021 par le groupe CompVis de l'Université Louis-et-Maximilien de Munich.
Stable Diffusion se compose de trois parties : un autoencodeur variationnel (VAE), un U-Net et un encodeur de texte optionnel. L'encodeur VAE compresse les images de l'espace des pixels vers un espace latent plus petit, capturant la signification sémantique fondamentale. Un bruit gaussien est appliqué de manière itérative à la représentation latente compressée pendant la diffusion directe. Le bloc U-Net, composé d'un backbone ResNet, débruite la sortie pour obtenir une représentation latente, et le décodeur VAE génère l'image finale en convertissant la représentation vers l'espace des pixels.
L'étape de débruitage peut être conditionnée par du texte, une image ou une autre modalité via un mécanisme d'attention croisée. Pour le conditionnement textuel, un encodeur de texte CLIP ViT-L/14 fixe et pré-entraîné transforme les invites en un espace d'embedding. Les chercheurs soulignent l'efficacité computationnelle accrue pour l'entraînement et la génération comme un avantage des LDM. Avec 860 millions de paramètres dans le U-Net et 123 millions dans l'encodeur de texte, Stable Diffusion est relativement léger selon les normes de 2022 et peut fonctionner sur des GPU grand public, ou même uniquement sur CPU avec la version OpenVINO.
#### SD XL
La version XL utilise la même architecture LDM mais plus grande : un backbone UNet plus grand, un contexte d'attention croisée plus large, deux encodeurs de texte au lieu d'un, et un entraînement sur plusieurs ratios d'aspect. Le SD XL Refiner, publié simultanément, a la même architecture mais a été entraîné pour ajouter des détails fins à des images préexistantes via img2img conditionné par texte.
#### SD 3.0
La version 3.0 change entièrement le backbone, utilisant un Rectified Flow Transformer plutôt qu'un UNet. L'architecture comporte trois pistes pour l'encodage de texte original, l'encodage de texte transformé et l'encodage d'image dans l'espace latent, les deux dernières étant mélangées à chaque bloc de transformeur. Elle est nommée "transformeur de diffusion multimodal" (MMDiT), reflétant le fait qu'elle mélange en interne les encodages de texte et d'image, contrairement aux versions DiT précédentes où le texte affecte l'image mais pas l'inverse.
Données d'entraînement
Stable Diffusion a été entraîné sur des paires image-légende de LAION-5B, un ensemble de données accessible au public dérivé des données web Common Crawl. LAION-5B contient 5 milliards de paires image-texte classées par langue et filtrées par résolution, probabilité de filigrane et score esthétique prédit. L'ensemble de données a été créé par LAION, une organisation allemande à but non lucratif financée par Stability AI. Le modèle a été entraîné sur trois sous-ensembles : laion2B-en, laion-high-resolution et laion-aesthetics v2 5+. Une analyse tierce d'un sous-ensemble plus petit de 12 millions d'images a révélé qu'environ 47 % provenaient de 100 domaines, Pinterest représentant 8,5 %, suivi de WordPress, Blogspot, Flickr, DeviantArt et Wikimedia Commons. Une enquête de Bayerischer Rundfunk a montré que les ensembles de données de LAION, hébergés sur Hugging Face, contiennent de grandes quantités de données privées et sensibles.
Procédures d'entraînement
Le modèle a d'abord été entraîné sur laion2B-en et laion-high-resolution, avec des étapes finales sur LAION-Aesthetics v2 5+, un sous-ensemble de 600 millions d'images légendées prédites pour recevoir un score d'au moins 5 sur 10 de la part d'évaluateurs humains. Ce sous-ensemble excluait les images à basse résolution et celles avec une probabilité de filigrane prédite supérieure à 80 %. Les étapes finales d'entraînement ont réduit de 10 % le conditionnement textuel pour améliorer le Classifier-Free Diffusion Guidance. Le modèle a été entraîné en utilisant 256 GPU Nvidia A100 sur Amazon Web Services pendant 150 000 heures GPU, pour un coût de 600 000 dollars.
Limitations
Stable Diffusion présente des problèmes connus de dégradation, comme des difficultés à rendre les mains et le texte, et peut produire un contenu biaisé ou nuisible en raison des données d'entraînement. La publication publique a soulevé des préoccupations concernant les usages abusifs, notamment les deepfakes et la violation du droit d'auteur, conduisant à des débats en cours sur la réglementation et l'utilisation éthique dans la communauté du machine learning.
Impact
La publication de Stable Diffusion en 2022 a considérablement accéléré le mouvement artistique du deep learning, permettant aux amateurs et aux artistes de générer des images de haute qualité sur du matériel personnel. Il a influencé les modèles texte-vers-image ultérieurs et a contribué à la vague plus large de l'IA, avec des applications dans l'art, le design et la création de contenu. La nature open source du modèle a favorisé un vaste écosystème d'outils communautaires et de variantes affinées, bien qu'il ait également suscité des discussions sur la propriété intellectuelle et l'avenir du travail créatif.
Réception et héritage
Le modèle a reçu une attention considérable pour ses réalisations techniques et son accessibilité. Il a été salué pour son efficacité et sa qualité, mais aussi critiqué pour son potentiel d'abus. En 2025, Stable Diffusion reste une référence fondamentale dans l'IA générative, avec un développement continu par Stability AI et la communauté open source. Son architecture et son approche d'entraînement ont été adaptées dans de nombreux modèles ultérieurs, consolidant son héritage dans le domaine.