Version de Stable Diffusion

Traduit de l'anglais

Stable Diffusion est un modèle d'apprentissage profond open-source de génération d'images à partir de texte, publié en 2022 par Stability AI, qui a popularisé l'art génératif en fonctionnant sur du matériel grand public. Il utilise la diffusion latente pour générer des images détaillées à partir de prompts textuels.

Stable Diffusion est un modèle d'apprentissage profond, de type texte-vers-image, publié en 2022 et basé sur des techniques de diffusion. Cette technologie d'IA générative est le produit phare de Stability AI et est considérée comme faisant partie de la vague actuelle de l'IA. Elle est principalement utilisée pour générer des images détaillées conditionnées par des descriptions textuelles, bien qu'elle puisse également être appliquée à d'autres tâches telles que l'inpainting, l'outpainting et la génération de traductions image-vers-image guidées par une invite textuelle. Son développement a impliqué des chercheurs du groupe CompVis de l'Université Louis-et-Maximilien de Munich et de Runway, avec un don de calcul de la part de Stability et des données d'entraînement provenant d'organisations à but non lucratif.

Stable Diffusion est un modèle de diffusion latent, un type de réseau neuronal artificiel génératif profond. Son code et ses poids de modèle ont été publiés publiquement, et une version optimisée peut fonctionner sur la plupart des matériels grand public équipés d'un GPU modeste avec aussi peu que 2,4 Go de VRAM. Cela a marqué une rupture avec les modèles texte-vers-image propriétaires précédents tels que DALL-E et Midjourney, qui n'étaient accessibles que via des services cloud.

Développement

Stable Diffusion est issu d'un projet appelé diffusion latente, développé en Allemagne par des chercheurs de l'Université Louis-et-Maximilien de Munich et de l'Université de Heidelberg. Quatre des cinq auteurs originaux (Robin Rombach, Andreas Blattmann, Patrick Esser et Dominik Lorenz) ont ensuite rejoint Stability AI et ont publié des versions ultérieures de Stable Diffusion. La licence technique du modèle a été publiée par le groupe CompVis de l'Université Louis-et-Maximilien de Munich. Le développement a été dirigé par Patrick Esser de Runway et Robin Rombach de CompVis, qui figuraient parmi les chercheurs ayant précédemment inventé l'architecture de modèle de diffusion latente utilisée par Stable Diffusion. Stability AI a également crédité EleutherAI et LAION, une organisation allemande à but non lucratif qui a assemblé le jeu de données sur lequel Stable Diffusion a été entraîné, comme soutiens du projet.

La publication de Stable Diffusion en 2022 a marqué un changement significatif dans l'accessibilité des outils d'IA générative. Contrairement aux modèles antérieurs qui nécessitaient un accès cloud, Stable Diffusion pouvait être exécuté localement, permettant à une communauté plus large d'artistes et de développeurs d'expérimenter la génération texte-vers-image. Cela a contribué à son adoption rapide et à la prolifération de l'art généré par IA sur diverses plateformes en ligne.

Technologie

Architecture

Les modèles de diffusion, introduits en 2015, sont entraînés avec pour objectif de supprimer les applications successives de bruit gaussien sur les images d'entraînement, ce qui peut être considéré comme une séquence d'autoencodeurs de débruitage. Le nom de diffusion provient de la diffusion thermodynamique, car ils ont d'abord été développés avec l'inspiration de la thermodynamique. Les modèles de la série Stable Diffusion avant SD 3 utilisaient tous une variante des modèles de diffusion, appelée modèle de diffusion latent (LDM), développée en 2021 par le groupe CompVis (Computer Vision & Learning) de l'Université Louis-et-Maximilien de Munich.

Stable Diffusion se compose de trois parties : l'autoencodeur variationnel (VAE), le U-Net et un encodeur de texte optionnel. L'encodeur VAE compresse l'image de l'espace des pixels à un espace latent de dimension inférieure, capturant une signification sémantique plus fondamentale de l'image. Un bruit gaussien est appliqué de manière itérative à la représentation latente compressée pendant la diffusion directe. Le bloc U-Net, composé d'un backbone ResNet, débruite la sortie de la diffusion directe en arrière pour obtenir une représentation latente. Enfin, le décodeur VAE génère l'image finale en convertissant la représentation de retour dans l'espace des pixels.

L'étape de débruitage peut être conditionnée de manière flexible par une chaîne de texte, une image ou une autre modalité. Les données de conditionnement encodées sont exposées aux U-Nets de débruitage via un mécanisme d'attention croisée. Pour le conditionnement sur texte, l'encodeur de texte CLIP ViT-L/14 fixe et pré-entraîné est utilisé pour transformer les invites textuelles en un espace d'embedding. Les chercheurs soulignent une efficacité computationnelle accrue pour l'entraînement et la génération comme un avantage des LDM. Avec 860 millions de paramètres dans le U-Net et 123 millions dans l'encodeur de texte, Stable Diffusion est considéré comme relativement léger selon les normes de 2022, et contrairement à d'autres modèles de diffusion, il peut fonctionner sur des GPU grand public, et même sur CPU uniquement si l'on utilise la version OpenVINO de Stable Diffusion.

#### SD XL

La version XL utilise la même architecture LDM que les versions précédentes, sauf qu'elle est plus grande : un backbone UNet plus grand, un contexte d'attention croisée plus large, deux encodeurs de texte au lieu d'un, et entraînée sur plusieurs ratios d'aspect (pas seulement le ratio carré comme les versions précédentes). Le SD XL Refiner, publié en même temps, a la même architecture que SD XL, mais il a été entraîné pour ajouter des détails fins aux images préexistantes via img2img conditionné par texte.

#### SD 3.0

La version 3.0 change complètement le backbone. Ce n'est pas un UNet, mais un Rectified Flow Transformer, qui implémente la méthode de flux rectifié avec un transformateur. L'architecture Transformer utilisée pour SD 3.0 a trois "pistes", pour l'encodage de texte original, l'encodage de texte transformé et l'encodage d'image (dans l'espace latent). L'encodage de texte transformé et l'encodage d'image sont mélangés pendant chaque bloc de transformateur. L'architecture est nommée "transformateur de diffusion multimodal (MMDiT)", où "multimodal" signifie qu'elle mélange les encodages de texte et d'image dans ses opérations. Cela diffère des versions précédentes de DiT, où l'encodage de texte affecte l'encodage d'image, mais pas l'inverse.

Données d'entraînement

Stable Diffusion a été entraîné sur des paires d'images et de légendes provenant de LAION-5B, un jeu de données accessible au public dérivé des données Common Crawl extraites du web, où 5 milliards de paires image-texte ont été classées par langue et filtrées en jeux de données séparés par résolution, une probabilité prédite de contenir un filigrane et un score "esthétique" prédit (par exemple, qualité visuelle subjective). Le jeu de données a été créé par LAION, une organisation allemande à but non lucratif qui reçoit des financements de Stability AI. Le modèle Stable Diffusion a été entraîné sur trois sous-ensembles de LAION-5B : laion2B-en, laion-high-resolution et laion-aesthetics v2 5+. Une analyse tierce des données d'entraînement du modèle a identifié que sur un sous-ensemble plus petit de 12 millions d'images provenant du jeu de données plus large original, environ 47 % de l'échantillon d'images provenait de 100 domaines différents, avec Pinterest représentant 8,5 % du sous-ensemble, suivi de sites web tels que WordPress, Blogspot, Flickr, DeviantArt et Wikimedia Commons. Une enquête de Bayerischer Rundfunk a montré que les jeux de données de LAION, hébergés sur Hugging Face, contiennent de grandes quantités de données privées et sensibles.

Procédures d'entraînement

Le modèle a d'abord été entraîné sur les sous-ensembles laion2B-en et laion-high-resolution, avec les dernières séries d'entraînement effectuées sur LAION-Aesthetics v2 5+, un sous-ensemble de 600 millions d'images légendées pour lesquelles le prédicteur LAION-Aesthetics Predictor V2 a prédit que les humains donneraient, en moyenne, un score d'au moins 5 sur 10 lorsqu'on leur demande d'évaluer à quel point ils les aiment. Le sous-ensemble LAION-Aesthetics v2 5+ excluait également les images basse résolution et les images que LAION-5B-WatermarkDetection identifiait comme portant un filigrane avec une probabilité supérieure à 80 %. Les dernières séries d'entraînement ont également supprimé 10 % du conditionnement textuel pour améliorer le Classifier-Free Diffusion Guidance. Le modèle a été entraîné en utilisant 256 GPU Nvidia A100 sur Amazon Web Services pour un total de 150 000 heures GPU, à un coût de 600 000 dollars.

Impact et héritage

La publication publique du code et des poids de Stable Diffusion a eu un impact profond sur le domaine de l'intelligence artificielle et de l'art numérique. Elle a démocratisé l'accès à la génération puissante texte-vers-image, permettant aux individus et aux petites équipes de créer des images de haute qualité sans avoir besoin d'une infrastructure cloud coûteuse. Cela a conduit à une augmentation des applications créatives, de l'art conceptuel et de l'illustration à la publicité et à la conception de jeux. Le modèle a également stimulé davantage de recherches en apprentissage automatique, en particulier dans des domaines comme la compression de modèles et l'inférence efficace, car les développeurs cherchaient à exécuter le modèle sur du matériel de plus en plus modeste.

Stable Diffusion a également soulevé d'importantes questions éthiques et juridiques concernant le droit d'auteur, la confidentialité des données et le potentiel de mauvaise utilisation. L'utilisation de données web extraites pour l'entraînement, y compris des images protégées par le droit d'auteur et des informations personnelles, est devenue un sujet de débat et de litige. Ces préoccupations ont incité à des discussions sur la nécessité de pratiques de données plus transparentes et responsables dans le développement de modèles génératifs, influençant les travaux ultérieurs dans le domaine.

Limites

Stable Diffusion présente des problèmes de dégradation et d'artefacts, en particulier lors de la génération de scènes complexes ou de texte. Il peut avoir des difficultés avec la correction anatomique, produisant des images avec des mains ou des visages déformés, et peut ne pas rendre avec précision le texte dans les images. Les performances du modèle dépendent également de la qualité et de la diversité de ses données d'entraînement, ce qui peut entraîner des biais dans les images générées. De plus, le coût computationnel de l'entraînement et du fine-tuning de grands modèles comme SD 3.0 reste significatif, limitant l'expérimentation pour certains chercheurs et développeurs.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-image·deep-learning·open-source
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique