Traduit de l'anglais

Stable Diffusion est un modèle open-source de texte vers image publié en août 2022 par Stability AI, basé sur la technologie de diffusion latente. Il génère des images détaillées à partir de prompts textuels et fonctionne sur du matériel grand public, marquant un changement par rapport aux modèles propriétaires exclusivement cloud.

Stable Diffusion est un modèle d'apprentissage profond, de type texte-à-image, publié en août 2022, basé sur des techniques de diffusion. Il est le produit phare de Stability AI et est considéré comme faisant partie de l'essor de l'IA en cours. Le modèle génère des images détaillées conditionnées par des descriptions textuelles, et il prend également en charge des tâches telles que l'inpainting, l'outpainting et la traduction d'image à image guidée par des invites textuelles. Son développement a impliqué des chercheurs du groupe CompVis de l'Université LMU de Munich et de Runway, avec un don de calcul de la part de Stability AI et des données d'entraînement provenant d'organisations à but non lucratif.

Stable Diffusion est un modèle de diffusion latent, un type de réseau neuronal artificiel génératif profond. Son code et ses poids de modèle ont été publiés publiquement, et une version optimisée fonctionne sur la plupart des matériels grand public avec un GPU modeste utilisant aussi peu que 2,4 Go de VRAM. Cette rupture par rapport aux modèles texte-à-image propriétaires comme DALL-E et Midjourney, qui n'étaient accessibles que via des services cloud, a rendu Stable Diffusion largement disponible pour les utilisateurs individuels et les chercheurs.

Développement

Stable Diffusion est issu d'un projet appelé diffusion latente, développé en Allemagne par des chercheurs de l'Université LMU de Munich et de l'Université de Heidelberg. Quatre des cinq auteurs originaux - Robin Rombach, Andreas Blattmann, Patrick Esser et Dominik Lorenz - ont ensuite rejoint Stability AI et publié des versions ultérieures. La licence technique a été publiée par le groupe CompVis de l'Université LMU de Munich. Le développement a été dirigé par Patrick Esser de Runway et Robin Rombach de CompVis, qui avaient précédemment inventé l'architecture de diffusion latente. Stability AI a également crédité EleutherAI et LAION, une organisation allemande à but non lucratif qui a assemblé l'ensemble de données d'entraînement, comme soutiens du projet.

Technologie

Architecture

Les modèles de diffusion, introduits en 2015, sont entraînés à supprimer les applications successives de bruit gaussien sur les images d'entraînement, fonctionnant comme une séquence d'autoencodeurs de débruitage. Le nom provient de la diffusion thermodynamique, car la technique a été inspirée par la thermodynamique. Les modèles de la série Stable Diffusion antérieurs à SD 3 utilisaient une variante appelée modèle de diffusion latent (LDM), développé en 2021 par le groupe CompVis de l'Université LMU de Munich.

Stable Diffusion se compose de trois parties : un autoencodeur variationnel (VAE), un U-Net et un encodeur de texte optionnel. L'encodeur VAE compresse les images de l'espace des pixels à un espace latent de dimension plus petite, capturant la signification sémantique. Un bruit gaussien est appliqué de manière itérative à la représentation latente compressée pendant la diffusion avant. Le bloc U-Net, composé d'un backbone ResNet, débruite la sortie en arrière pour obtenir une représentation latente. Enfin, le décodeur VAE génère l'image finale en convertissant la représentation de retour à l'espace des pixels.

L'étape de débruitage peut être conditionnée par du texte, une image ou une autre modalité. Les données de conditionnement encodées sont exposées aux U-Nets de débruitage via un mécanisme de Cross-Attention. Pour le conditionnement par texte, un encodeur de texte CLIP ViT-L/14 fixe et pré-entraîné transforme les invites en un espace d'embedding. Les chercheurs citent une efficacité de calcul accrue pour l'entraînement et la génération comme un avantage des LDM.

Avec 860 millions de paramètres dans le U-Net et 123 millions dans l'encodeur de texte, Stable Diffusion est relativement léger selon les normes de 2022. Contrairement à d'autres modèles de diffusion, il fonctionne sur des GPU grand public, et même uniquement sur CPU avec la version OpenVINO.

#### SD XL

La version XL utilise la même architecture LDM mais plus grande : un backbone UNet plus grand, un contexte de cross-attention plus large, deux encodeurs de texte au lieu d'un, et un entraînement sur plusieurs ratios d'aspect plutôt que uniquement carré. Le SD XL Refiner, publié simultanément, a la même architecture mais a été entraîné pour ajouter des détails fins aux images préexistantes via img2img conditionné par texte.

#### SD 3.0

La version 3.0 change complètement le backbone. Elle utilise un Rectified Flow Transformer, implémentant la méthode de flux rectifié avec une architecture Transformer (architecture). L'architecture a trois pistes : encodage de texte original, encodage de texte transformé et encodage d'image dans l'espace latent. L'encodage de texte transformé et l'encodage d'image sont mélangés pendant chaque bloc de transformateur. Cela est nommé "transformateur de diffusion multimodal (MMDiT)", où multimodal signifie qu'il mélange les encodages de texte et d'image dans ses opérations, contrairement aux versions DiT précédentes où l'encodage de texte affectait l'encodage d'image mais pas l'inverse.

Données d'entraînement

Stable Diffusion a été entraîné sur des paires image-légende de LAION-5B, un ensemble de données publiquement disponible dérivé de scrapes web Common Crawl. Les 5 milliards de paires image-texte ont été classées par langue et filtrées en ensembles de données par résolution, probabilité de filigrane prédite et score "esthétique" prédit. LAION, une organisation allemande à but non lucratif recevant un financement de Stability AI, a créé l'ensemble de données. Le modèle a été entraîné sur trois sous-ensembles : laion2B-en, laion-high-resolution et laion-aesthetics v2 5+.

Une analyse tierce d'un sous-ensemble plus petit de 12 millions d'images a trouvé qu'environ 47 % provenaient de 100 domaines, avec Pinterest prenant 8,5 %, suivi de WordPress, Blogspot, Flickr, DeviantArt et Wikimedia Commons. Une enquête de Bayerischer Rundfunk a montré que les ensembles de données de LAION, hébergés sur Hugging Face, contiennent de grandes quantités de données privées et sensibles.

Procédures d'entraînement

Le modèle a été initialement entraîné sur laion2B-en et laion-high-resolution, avec des tours finaux sur LAION-Aesthetics v2 5+, un sous-ensemble de 600 millions d'images légendées prédites pour recevoir au moins 5 sur 10 dans les évaluations esthétiques humaines. Ce sous-ensemble excluait les images à basse résolution et celles avec une probabilité de détection de filigrane supérieure à 80 %. Les tours d'entraînement finaux ont abandonné 10 % du conditionnement textuel pour améliorer la guidance de diffusion sans classifieur. L'entraînement a utilisé 256 GPU Nvidia A100 sur Amazon Web Services pour 150 000 heures GPU, coûtant 600 000 $.

Limitations

Stable Diffusion a des problèmes de dégradation et d'artefacts, en particulier dans les scènes complexes, l'anatomie humaine et le rendu de texte. Il peut reproduire des biais des données d'entraînement, y compris des stéréotypes et du contenu nuisible. Le modèle a du mal avec les détails fins comme les mains et les visages, produisant souvent des résultats déformés. Il a également des difficultés avec les invites compositionnelles impliquant plusieurs objets ou des relations spatiales spécifiques. En 2024, les versions plus récentes abordent certaines limitations mais font toujours face à des défis dans ces domaines.

Impact et réception

La publication publique de Stable Diffusion en août 2022 a suscité une large discussion sur l'éthique de l'IA générative, le droit d'auteur et le travail artistique. Sa nature open-source a permis aux développeurs de créer des outils pour l'expérimentation en apprentissage automatique, l'augmentation de données et les flux de travail créatifs. L'accessibilité du modèle sur le matériel grand public a contribué à une augmentation des communautés d'art IA et des applications commerciales. Stability AI a publié des versions ultérieures, y compris SD XL en 2023 et SD 3.0 en 2024, chacune améliorant la qualité et les capacités. Le modèle a également influencé les débats politiques, conduisant à des discussions sur la réglementation de l'IA et la provenance du contenu.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-image·open-source-software·diffusion-models
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique