Traduzido do inglês

O Stable Diffusion é um modelo de texto para imagem de código aberto lançado em agosto de 2022 pela Stability AI, baseado na tecnologia de difusão latente. Ele gera imagens detalhadas a partir de prompts de texto e roda em hardware de consumo, marcando uma mudança em relação aos modelos proprietários exclusivos de nuvem.

Stable Diffusion é um modelo de aprendizado profundo, de texto para imagem, lançado em agosto de 2022, baseado em técnicas de difusão. É o principal produto de Stability AI e é considerado parte do boom da IA em curso. O modelo gera imagens detalhadas condicionadas por descripções de texto e também suporta tarefas como inpainting, outpainting e tradução de imagem a imagem guiada por prompts de texto. O seu desenvolvimento envolveu pesquisadores do CompVis Group da LMU Munich e da Runway, com uma doação computacional de Stability AI e dados de treinamento de organizações sem fins lucrativos.

Stable Diffusion é um modelo de difusão latente, um tipo de rede neural artificial generativa profunda. Seu código e pesos de modelo foram publicados publicamente, e uma versão otimizada funciona na maioria de hardware de consumo com uma GPU modesta usando tão pouco como 2,4 GB de VRAM. Este afastamento de modelos proprietários de texto para imagem como DALL-E e Midjourney, que eram acessíveis apenas através de serviços de nube, tornou Stable Diffusion amplamente disponível para usuários individuais e pesquisadores.

Desenvolvimento

Stable Diffusion originou-se de um projeto chamado difusão latente, desenvolvido na Alemania por pesquisadores da LMU Munich e da Universidade de Heidelberg. Quatro dos cinco autores originais - Robin Rombach, Andreas Blattmann, Patrick Esser e Dominik Lorenz - uniram-se posteriormente a Stability AI e lançaram versões subsequentes. A licença técnica foi lançada pelo grupo CompVis da LMU Munich. O desenvolvimento foi liderado por Patrick Esser da Runway e Robin Rombach da CompVis, que haviam inventado anteriormente a arquitetura de difusão latente. Stability AI também creditou EleutherAI e LAION, uma organização alemã sem fins lucrativos que montou o conjunto de dados de treinamento, como apoiadores do projeto.

Tecnologia

Arquitectura

Modelos de difusão, introducidos em 2015, são treinados para remover aplicações sucessivas de ruido gaussiano em imagens de treinamento, funcionando como uma sequência de autoencoders de denoising. O nome vem da difusão termodinâmica, já que a técnica foi inspirada pela termodinámica. Modelos da série Stable Diffusion antes de SD 3 usavam uma variante chamada modelo de difusão latente (LDM), desenvolvido em 2021 pelo grupo CompVis da LMU Munich.

Stable Diffusion consiste em três partes: um autoencoder variacional (VAE), um U-Net e um codificador de texto opcional. O encoder VAE comprime imagens do espaço de píxeles a um espaço latente de menor dimensão, capturando significado semántico. Ruido gaussiano é aplicado iterativamente à representação latente comprimida durante a difusão direta. O bloco U-Net, composto por um backbone ResNet, denoisa a saída para atrás para obter uma representação latente. Finalmente, o decoder VAE gera a imagem final convertendo a representação de volta ao espaço de píxeles.

O passo de denoising pode ser condicionado por texto, uma imagem ou outra modalidade. Os dados de condicionamento codificados são expostos aos U-Nets de denoising através de um mecanismo de atenção cruzada. Para condicionamento por texto, um codificador de texto CLIP ViT-L/14 fixo e pré-treinado transforma prompts em um espaço de embedding. Os pesquisadores citan a maior eficiencia computacional para treinamento e generación como uma vantagem dos LDMs.

Com 860 milhões de parámetros no U-Net e 123 milhões no codificador de texto, Stable Diffusion é relativamente leve para os padrões de 2022. A diferença de outros modelos de difusão, funciona em GPUs de consumo, e incluso só com CPU usando a versão OpenVINO.

#### SD XL

A versão XL usa a mesma arquitetura LDM mas maior: um backbone UNet maior, contexto de atención cruzada maior, dois codificadores de texto em lugar de um, e treinamento em múltiples proporções de aspecto em lugar de só quadradas. O SD XL Refiner, lançado simultáneamente, tem a mesma arquitetura mas foi treinado para agregar detalhes finos a imagens preexistentes via img2img condicionado por texto.

#### SD 3.0

A versão 3.0 cambia completamente o backbone. Usa um Transformer de Flujo Rectificado, implementando o método de flujo rectificado com uma arquitectura transformador. A arquitectura tem três pistas: codificación de texto original, codificación de texto transformada e codificación de imagen en espacio latente. A codificación de texto transformada e a codificación de imagen son mezcladas durante cada bloque de transformer. Isto é chamado "transformer de difusión multimodal (MMDiT)", onde multimodal significa que mezcla codificaciones de texto e imagen dentro de suas operações, a diferença de versões DiT anteriores onde a codificación de texto afectava a codificación de imagen pero não viceversa.

Dados de Treinamento

Stable Diffusion foi treinado em pares de imagem-legenda de LAION-5B, um conjunto de dados disponível publicamente derivado de raspados web de Common Crawl. Os 5 mil milhões de pares de imagem-texto foram classificados por idioma e filtrados em conjuntos de dados por resolução, probabilidade prevista de marca de água e puntuación "estética" prevista. LAION, uma organização alemã sem fins lucrativos que recebe financiamento de Stability AI, criou o conjunto de dados. O modelo foi treinado em três subconjuntos: laion2B-en, laion-high-resolution e laion-aesthetics v2 5+.

Uma análise de terceiros de um subconjunto menor de 12 milhões de imagens encontrou que aproximadamente 47% vinham de 100 dominios, com Pinterest tomando 8,5%, seguido por WordPress, Blogspot, Flickr, DeviantArt e Wikimedia Commons. Uma investigação de Bayerischer Rundfunk mostrou que os conjuntos de dados de LAION, alojados em Hugging Face, contienen grandes cantidades de dados privados e sensibles.

Procedimentos de Treinamento

O modelo foi inicialmente treinado em laion2B-en e laion-high-resolution, com rondas finais em LAION-Aesthetics v2 5+, um subconjunto de 600 milhões de imagens con legendas previstas para receber pelo menos 5 de 10 em avaliações estéticas humanas. Este subconjunto excluía imagens de baixa resolução e aquelas com probabilidade de detección de marca de água acima de 80%. As rondas finais de treinamento eliminaram 10% do condicionamento de texto para melhorar a Guía de Difusión Libre de Clasificador. O treinamento usou 256 GPUs Nvidia A100 em Amazon Web Services por 150.000 horas de GPU, custando $600.000.

Limitaciones

Stable Diffusion tem problemas com degradación e artefactos, particularmente em escenas complexas, anatomia humana e renderização de texto. Pode reproduzir sesgos dos dados de treinamento, incluindo estereotipos e conteúdo dañino. O modelo tem dificultades com detalhes finos como manos e caras, produzindo frequentemente resultados distorsionados. Também tem dificultades com prompts compositivos que involucran múltiples objetos ou relações espaciales específicas. A partir de 2024, versões más novas abordam algumas limitaciones mas ainda enfrentan desafíos nestas áreas.

Impacto e Recepción

A liberación pública de Stable Diffusion em agosto de 2022 provocou uma amplia discusión sobre ética da IA generativa, direitos de autor e trabalho artístico. Sua natureza de código aberto permitiu a desenvolvedores criar ferramentas para experimentación em aprendizado automático, aumento de datos e fluxos de trabalho creativos. A acessibilidade do modelo em hardware de consumo contribuiu a um aumento nas comunidades de arte de IA e aplicações comerciais. Stability AI lançou versões subsequentes, incluindo SD XL em 2023 e SD 3.0 em 2024, cada uma melhorando qualidade e capacidades. O modelo também influenciou debates de políticas, levando a discusiones sobre regulación de IA e procedência de conteúdo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·text-to-image·open-source-software·diffusion-models
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico