Stability AI Stable Diffusion 2022

Traduzido do inglês

Stable Diffusion é um modelo de deep learning, texto-para-imagem, lançado em 2022 pela Stability AI, baseado em técnicas de difusão latente. Ele gera imagens detalhadas a partir de prompts de texto e é notável por seu lançamento público e pela capacidade de funcionar em hardware de consumo.

Stable Diffusion é um modelo de aprendizado profundo, de texto para imagem, lançado em 2022 pela Stability AI, baseado em técnicas de difusão. Ele é usado principalmente para gerar imagens detalhadas condicionadas a descrições de texto, embora também possa ser aplicado a tarefas como preenchimento de imagens (inpainting), expansão de imagens (outpainting) e traduções de imagem para imagem guiadas por um prompt de texto. O modelo é considerado parte do contínuo boom da IA generativa e marcou uma mudança em relação aos modelos proprietários anteriores de texto para imagem, como DALL-E e Midjourney, que eram acessíveis apenas por meio de serviços em nuvem.

Stable Diffusion é um modelo de difusão latente, um tipo de rede neural generativa profunda. Seu código e pesos de modelo foram disponibilizados publicamente, e uma versão otimizada pode ser executada na maioria dos hardwares de consumo equipados com uma GPU modesta com apenas 2,4 GB de VRAM. Essa acessibilidade o diferenciou de modelos anteriores e contribuiu para sua ampla adoção.

Desenvolvimento

Stable Diffusion originou-se de um projeto chamado difusão latente, desenvolvido na Alemanha por pesquisadores da LMU Munique e da Universidade de Heidelberg. Quatro dos cinco autores originais - Robin Rombach, Andreas Blattmann, Patrick Esser e Dominik Lorenz - posteriormente se juntaram à Stability AI e lançaram versões subsequentes do modelo. A licença técnica foi lançada pelo grupo CompVis da LMU Munique, com desenvolvimento liderado por Patrick Esser da Runway e Robin Rombach da CompVis, que haviam inventado anteriormente a arquitetura de difusão latente. A Stability AI também creditou a EleutherAI e a LAION, uma organização sem fins lucrativos alemã que montou o conjunto de dados de treinamento, como apoiadores.

Tecnologia

Arquitetura

Modelos de difusão, introduzidos em 2015, são treinados para remover aplicações sucessivas de ruído gaussiano em imagens de treinamento, semelhante a uma sequência de autoencoders de denoising. O nome deriva da difusão termodinâmica, pois o desenvolvimento inicial foi inspirado pela termodinâmica. Os modelos da série Stable Diffusion anteriores ao SD 3 usavam uma variante chamada modelo de difusão latente (LDM), desenvolvida em 2021 pelo grupo CompVis da LMU Munique.

Stable Diffusion consiste em três partes: um autoencoder variacional (VAE), uma U-Net e um codificador de texto opcional. O codificador VAE comprime imagens do espaço de pixels para um espaço latente menor, capturando o significado semântico fundamental. Ruído gaussiano é aplicado iterativamente à representação latente comprimida durante a difusão direta. O bloco U-Net, composto por uma espinha dorsal ResNet, remove o ruído da saída para obter uma representação latente, e o decodificador VAE gera a imagem final convertendo a representação de volta ao espaço de pixels.

A etapa de denoising pode ser condicionada a texto, imagem ou outra modalidade por meio de um mecanismo de atenção cruzada. Para condicionamento por texto, um codificador de texto CLIP ViT-L/14 fixo e pré-treinado transforma prompts em um espaço de incorporação. Pesquisadores apontam o aumento da eficiência computacional para treinamento e geração como uma vantagem dos LDMs. Com 860 milhões de parâmetros na U-Net e 123 milhões no codificador de texto, o Stable Diffusion é relativamente leve para os padrões de 2022 e pode ser executado em GPUs de consumo, ou até mesmo apenas com CPU usando a versão OpenVINO.

#### SD XL

A versão XL usa a mesma arquitetura LDM, mas maior: uma espinha dorsal UNet maior, contexto de atenção cruzada maior, dois codificadores de texto em vez de um e treinamento em múltiplas proporções de aspecto. O SD XL Refiner, lançado simultaneamente, tem a mesma arquitetura, mas foi treinado para adicionar detalhes finos a imagens pré-existentes por meio de img2img condicionado por texto.

#### SD 3.0

A versão 3.0 muda completamente a espinha dorsal, usando um Transformer de Fluxo Retificado em vez de uma UNet. A arquitetura tem três trilhas para codificação de texto original, codificação de texto transformada e codificação de imagem no espaço latente, com as duas últimas misturadas durante cada bloco do transformer. É chamada de "transformer de difusão multimodal" (MMDiT), refletindo que mistura internamente codificações de texto e imagem, ao contrário das versões DiT anteriores, onde o texto afeta a imagem, mas não vice-versa.

Dados de Treinamento

Stable Diffusion foi treinado em pares de imagem-legenda do LAION-5B, um conjunto de dados disponível publicamente derivado de dados da web do Common Crawl. O LAION-5B contém 5 bilhões de pares de imagem-texto classificados por idioma e filtrados por resolução, probabilidade de marca d'água e pontuação estética prevista. O conjunto de dados foi criado pela LAION, uma organização sem fins lucrativos alemã financiada pela Stability AI. O modelo foi treinado em três subconjuntos: laion2B-en, laion-high-resolution e laion-aesthetics v2 5+. Uma análise de terceiros de um subconjunto menor de 12 milhões de imagens descobriu que aproximadamente 47% vieram de 100 domínios, com o Pinterest respondendo por 8,5%, seguido por WordPress, Blogspot, Flickr, DeviantArt e Wikimedia Commons. Uma investigação da Bayerischer Rundfunk mostrou que os conjuntos de dados da LAION, hospedados no Hugging Face, contêm grandes quantidades de dados privados e sensíveis.

Procedimentos de Treinamento

O modelo foi inicialmente treinado em laion2B-en e laion-high-resolution, com rodadas finais no LAION-Aesthetics v2 5+, um subconjunto de 600 milhões de imagens legendadas previstas para receber uma pontuação de pelo menos 5 em 10 de avaliadores humanos. Este subconjunto excluiu imagens de baixa resolução e aquelas com probabilidade de marca d'água prevista maior que 80%. As rodadas finais de treinamento reduziram 10% do condicionamento de texto para melhorar a Orientação de Difusão Livre de Classificador. O modelo foi treinado usando 256 GPUs Nvidia A100 na Amazon Web Services por 150.000 horas de GPU, a um custo de US$ 600.000.

Limitações

Stable Diffusion tem problemas conhecidos com degradação, como dificuldade em renderizar mãos e texto, e pode produzir conteúdo tendencioso ou prejudicial devido aos dados de treinamento. O lançamento público levantou preocupações sobre uso indevido, incluindo deepfakes e violação de direitos autorais, levando a debates contínuos sobre regulamentação e uso ético na comunidade de aprendizado de máquina.

Impacto

O lançamento do Stable Diffusion em 2022 acelerou significativamente o movimento de arte com aprendizado profundo, permitindo que amadores e artistas gerassem imagens de alta qualidade em hardware pessoal. Ele influenciou modelos subsequentes de texto para imagem e contribuiu para o boom mais amplo da IA, com aplicações em arte, design e criação de conteúdo. A natureza de código aberto do modelo fomentou um grande ecossistema de ferramentas comunitárias e variantes ajustadas, embora também tenha gerado discussões sobre propriedade intelectual e o futuro do trabalho criativo.

Recepção e Legado

O modelo recebeu atenção generalizada por suas conquistas técnicas e acessibilidade. Foi elogiado por sua eficiência e qualidade, mas também criticado por potencial uso indevido. Em 2025, o Stable Diffusion permanece como uma referência fundamental na IA generativa, com desenvolvimento contínuo pela Stability AI e pela comunidade de código aberto. Sua arquitetura e abordagem de treinamento foram adaptadas em numerosos modelos subsequentes, consolidando seu legado no campo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·text-to-image·deep-learning·open-source-software
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico