Stable Diffusion août 2022

Traduit de l'anglais

Stable Diffusion est un modèle d'apprentissage profond de génération d'images à partir de texte, publié en août 2022 par Stability AI, basé sur des techniques de diffusion latente. Il génère des images détaillées à partir de prompts textuels et se distingue par sa publication en open source, permettant une adoption large sur du matériel grand public.

Stable Diffusion est un modèle d'apprentissage profond de type texte-vers-image, publié en août 2022, développé par des chercheurs du groupe CompVis de l'Université Louis-et-Maximilien de Munich et Runway, avec le soutien computationnel de Stability AI et des données d'entraînement provenant d'organisations à but non lucratif. C'est un modèle de diffusion latent, un type de réseau neuronal artificiel génératif profond, et il est considéré comme un produit phare de Stability AI, contribuant à l'essor actuel de l'IA. Le code et les poids du modèle ont été publiés publiquement, permettant de l'exécuter sur du matériel grand public avec des GPU modestes (dès 2,4 Go de VRAM), une rupture par rapport aux modèles propriétaires comme DALL-E et Midjourney, qui n'étaient accessibles que via des services cloud.

Le cas d'utilisation principal est la génération d'images détaillées conditionnées par des descriptions textuelles, mais il prend également en charge des tâches telles que l'inpainting, l'outpainting et la traduction image-vers-image guidée par des invites textuelles. Sa nature open source et son efficacité ont conduit à une adoption rapide dans diverses applications, de l'art numérique à la recherche.

Développement

Stable Diffusion est issu d'un projet appelé diffusion latent, développé en Allemagne par des chercheurs de l'Université Louis-et-Maximilien de Munich et de l'Université de Heidelberg. Quatre des cinq auteurs originaux (Robin Rombach, Andreas Blattmann, Patrick Esser et Dominik Lorenz) ont ensuite rejoint Stability AI et publié des versions ultérieures. La licence technique a été publiée par le groupe CompVis de l'Université Louis-et-Maximilien de Munich. Le développement a été dirigé par Patrick Esser de Runway et Robin Rombach de CompVis, qui figurent parmi les inventeurs de l'architecture de diffusion latent. Stability AI a également crédité EleutherAI et LAION, une organisation allemande à but non lucratif qui a assemblé l'ensemble de données d'entraînement, comme soutiens.

Technologie

Architecture

Les modèles de diffusion, introduits en 2015, sont entraînés à éliminer les applications successives de bruit gaussien sur les images d'entraînement, fonctionnant comme une séquence d'autoencodeurs de débruitage. Le nom dérive de la diffusion thermodynamique, car ils ont été inspirés par la thermodynamique. Stable Diffusion utilise une variante appelée modèle de diffusion latent (LDM), développé en 2021 par le groupe CompVis.

Le modèle se compose de trois parties : un autoencodeur variationnel (VAE), un U-Net et un encodeur de texte optionnel. L'encodeur VAE compresse les images de l'espace des pixels à un espace latent plus petit, capturant la signification sémantique. Un bruit gaussien est appliqué de manière itérative à la représentation latente compressée pendant la diffusion avant. Le U-Net, composé d'un backbone ResNet, débruite la sortie pour obtenir une représentation latente. Enfin, le décodeur VAE génère l'image finale en convertissant la représentation en espace des pixels.

L'étape de débruitage peut être conditionnée par du texte, des images ou d'autres modalités via un mécanisme d'attention croisée. Pour le conditionnement textuel, un encodeur de texte CLIP ViT-L/14 fixe et pré-entraîné transforme les invites en un espace d'intégration. Les LDM offrent une efficacité computationnelle accrue pour l'entraînement et la génération. Avec 860 millions de paramètres dans le U-Net et 123 millions dans l'encodeur de texte, Stable Diffusion est relativement léger selon les normes de 2022, capable de fonctionner sur des GPU grand public et même sur CPU uniquement avec la version OpenVINO.

SD XL

La version XL utilise la même architecture LDM mais plus grande : un backbone UNet plus grand, un contexte d'attention croisée plus étendu, deux encodeurs de texte au lieu d'un, et un entraînement sur plusieurs ratios d'aspect. Le SD XL Refiner, publié simultanément, a la même architecture mais a été entraîné pour ajouter des détails fins aux images existantes via img2img conditionné par texte.

SD 3.0

La version 3.0 change entièrement le backbone, utilisant un Rectified Flow Transformer au lieu d'un UNet. L'architecture Transformer a trois pistes : encodage de texte original, encodage de texte transformé et encodage d'image (dans l'espace latent). L'encodage de texte transformé et l'encodage d'image sont mélangés à chaque bloc de transformer. Cette architecture est nommée « transformateur de diffusion multimodal (MMDiT) », où « multimodal » signifie qu'elle mélange les encodages de texte et d'image dans ses opérations, différant des versions DiT précédentes où l'encodage de texte n'affectait que l'encodage d'image.

Données d'entraînement

Stable Diffusion a été entraîné sur des paires image-légende provenant de LAION-5B, un ensemble de données publiquement disponible dérivé des données Common Crawl, contenant 5 milliards de paires image-texte filtrées par langue, résolution, probabilité de filigrane et score esthétique prédit. L'ensemble de données a été créé par LAION, une organisation allemande à but non lucratif financée par Stability AI. Le modèle a été entraîné sur trois sous-ensembles : laion2B-en, laion-high-resolution et laion-aesthetics v2 5+. Une analyse tierce d'un sous-ensemble plus petit de 12 millions d'images a révélé qu'environ 47 % provenaient de 100 domaines différents, Pinterest représentant 8,5 %, suivi de WordPress, Blogspot, Flickr, DeviantArt et Wikimedia Commons. Une enquête de Bayerischer Rundfunk a révélé que les ensembles de données de LAION, hébergés sur Hugging Face, contiennent de grandes quantités de données privées et sensibles.

Procédures d'entraînement

Le modèle a d'abord été entraîné sur laion2B-en et laion-high-resolution, avec des étapes finales sur LAION-Aesthetics v2 5+, un sous-ensemble de 600 millions d'images légendées prédites pour obtenir un score d'au moins 5 sur 10 pour la qualité esthétique. Ce sous-ensemble excluait les images à basse résolution et celles avec une probabilité de filigrane supérieure à 80 %. Les étapes finales d'entraînement ont réduit de 10 % le conditionnement textuel pour améliorer le guidage de diffusion sans classificateur. Le modèle a été entraîné à l'aide de 256 GPU Nvidia A100 sur Amazon Web Services pour un total de 150 000 heures GPU, à un coût de 600 000 dollars.

Limites

Stable Diffusion présente des limites connues, notamment des difficultés avec les scènes complexes, des inexactitudes anatomiques (par exemple, les mains) et des biais dans les données d'entraînement. Il peut également générer des images reflétant les biais sociétaux présents dans l'ensemble de données. Le modèle peut avoir du mal avec le rendu du texte et les détails fins, et ses performances varient selon les invites. En 2024, des recherches en cours abordent ces problèmes grâce à un réglage fin et des améliorations architecturales.

Impact et adoption

La publication publique de Stable Diffusion en août 2022 a marqué un changement significatif dans l'IA générative, rendant la génération texte-vers-image de haute qualité accessible à un large public. Sa licence open source a permis aux développeurs de l'intégrer dans diverses applications, des outils d'art aux plateformes éducatives. L'efficacité du modèle a permis de l'exécuter sur du matériel grand public, favorisant une communauté de passionnés et de chercheurs. Cette publication a également suscité des discussions sur le droit d'auteur, l'éthique et l'utilisation abusive potentielle du contenu généré par l'IA. Stability AI a continué à publier des versions améliorées, telles que SD XL et SD 3.0, maintenant sa position dans le domaine en évolution rapide de l'intelligence artificielle.

Orientations futures

Les versions ultérieures de Stable Diffusion ont exploré différentes architectures, comme le Rectified Flow Transformer dans SD 3.0, visant à améliorer la qualité et l'efficacité. La recherche se poursuit sur la réduction des biais, l'amélioration de la contrôlabilité et l'intégration avec d'autres modalités. Le succès du modèle a influencé d'autres projets de apprentissage automatique et a contribué à l'essor plus large de l'IA, avec des implications pour l'apprentissage profond et les réseaux neuronaux. En 2025, Stable Diffusion reste une référence dans la génération texte-vers-image, avec un développement communautaire et corporatif continu.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-image·open-source·deep-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique