Stable Diffusion (agosto de 2022)

Traduzido do inglês

Stable Diffusion é um modelo de aprendizado profundo, de texto para imagem, lançado em agosto de 2022 pela Stability AI, baseado em técnicas de difusão latente. Ele gera imagens detalhadas a partir de prompts de texto e é notável por seu lançamento de código aberto, permitindo ampla adoção em hardware de consumo.

Stable Diffusion é um modelo de aprendizado profundo, de texto para imagem, lançado em agosto de 2022, desenvolvido por pesquisadores do Grupo CompVis da LMU Munique e da Runway, com suporte computacional da Stability AI e dados de treinamento de organizações sem fins lucrativos. É um modelo de difusão latente, um tipo de rede neural artificial generativa profunda, e é considerado um produto de destaque da Stability AI, contribuindo para o atual boom da IA. O código e os pesos do modelo foram disponibilizados publicamente, permitindo que ele fosse executado em hardware de consumo com GPUs modestas (a partir de 2,4 GB de VRAM), uma mudança em relação a modelos proprietários como DALL-E e Midjourney, que eram acessíveis apenas por meio de serviços em nuvem.

O principal caso de uso é gerar imagens detalhadas condicionadas a descrições de texto, mas também suporta tarefas como inpaint, outpaint e tradução de imagem para imagem guiada por prompts de texto. Sua natureza de código aberto e eficiência levaram a uma rápida adoção em várias aplicações, desde arte digital até pesquisa.

Desenvolvimento

O Stable Diffusion originou-se de um projeto chamado difusão latente, desenvolvido na Alemanha por pesquisadores da LMU Munique e da Universidade de Heidelberg. Quatro dos cinco autores originais (Robin Rombach, Andreas Blattmann, Patrick Esser e Dominik Lorenz) posteriormente se juntaram à Stability AI e lançaram versões subsequentes. A licença técnica foi lançada pelo grupo CompVis da LMU Munique. O desenvolvimento foi liderado por Patrick Esser, da Runway, e Robin Rombach, da CompVis, que estavam entre os inventores da arquitetura de difusão latente. A Stability AI também creditou a EleutherAI e a LAION, uma organização alemã sem fins lucrativos que montou o conjunto de dados de treinamento, como apoiadores.

Tecnologia

Arquitetura

Modelos de difusão, introduzidos em 2015, são treinados para remover aplicações sucessivas de ruído gaussiano em imagens de treinamento, funcionando como uma sequência de autoencoders de denoising. O nome deriva da difusão termodinâmica, pois foram inspirados pela termodinâmica. O Stable Diffusion usa uma variante chamada modelo de difusão latente (LDM), desenvolvido em 2021 pelo grupo CompVis.

O modelo consiste em três partes: um autoencoder variacional (VAE), um U-Net e um codificador de texto opcional. O codificador VAE comprime imagens do espaço de pixels para um espaço latente menor, capturando o significado semântico. Ruído gaussiano é aplicado iterativamente à representação latente comprimida durante a difusão direta. O U-Net, composto por um backbone ResNet, remove o ruído da saída para obter uma representação latente. Finalmente, o decodificador VAE gera a imagem final convertendo a representação de volta ao espaço de pixels.

A etapa de denoising pode ser condicionada a texto, imagens ou outras modalidades por meio de um mecanismo de atenção cruzada. Para condicionamento de texto, um codificador de texto CLIP ViT-L/14 fixo e pré-treinado transforma prompts em um espaço de incorporação. LDMs oferecem maior eficiência computacional para treinamento e geração. Com 860 milhões de parâmetros no U-Net e 123 milhões no codificador de texto, o Stable Diffusion é relativamente leve para os padrões de 2022, capaz de rodar em GPUs de consumo e até mesmo apenas em CPU com a versão OpenVINO.

SD XL

A versão XL usa a mesma arquitetura LDM, mas maior: um backbone UNet maior, contexto de atenção cruzada maior, dois codificadores de texto em vez de um e treinamento em múltiplas proporções de aspecto. O SD XL Refiner, lançado simultaneamente, tem a mesma arquitetura, mas foi treinado para adicionar detalhes finos a imagens existentes via img2img condicionado por texto.

SD 3.0

A versão 3.0 muda o backbone inteiramente, usando um Transformer de Fluxo Retificado em vez de um UNet. A arquitetura Transformer tem três trilhas: codificação de texto original, codificação de texto transformada e codificação de imagem (no espaço latente). A codificação de texto transformada e a codificação de imagem são misturadas durante cada bloco do transformer. Esta arquitetura é chamada de "transformer de difusão multimodal (MMDiT)", onde "multimodal" significa que mistura codificações de texto e imagem dentro de suas operações, diferindo das versões DiT anteriores, onde a codificação de texto afetava apenas a codificação de imagem.

Dados de Treinamento

O Stable Diffusion foi treinado em pares de imagem-legenda do LAION-5B, um conjunto de dados publicamente disponível derivado de dados do Common Crawl, contendo 5 bilhões de pares de imagem-texto filtrados por idioma, resolução, probabilidade de marca d'água e pontuação estética prevista. O conjunto de dados foi criado pela LAION, uma organização sem fins lucrativos alemã financiada pela Stability AI. O modelo foi treinado em três subconjuntos: laion2B-en, laion-high-resolution e laion-aesthetics v2 5+. Uma análise de terceiros de um subconjunto menor de 12 milhões de imagens descobriu que aproximadamente 47% vieram de 100 domínios diferentes, com o Pinterest ocupando 8,5%, seguido por WordPress, Blogspot, Flickr, DeviantArt e Wikimedia Commons. Uma investigação do Bayerischer Rundfunk revelou que os conjuntos de dados da LAION, hospedados no Hugging Face, contêm grandes quantidades de dados privados e sensíveis.

Procedimentos de Treinamento

O modelo foi inicialmente treinado em laion2B-en e laion-high-resolution, com rodadas finais em LAION-Aesthetics v2 5+, um subconjunto de 600 milhões de imagens legendadas previstas para receber uma pontuação de pelo menos 5 em 10 para qualidade estética. Este subconjunto excluiu imagens de baixa resolução e aquelas com probabilidade de marca d'água superior a 80%. As rodadas finais de treinamento reduziram 10% do condicionamento de texto para melhorar a Orientação de Difusão Livre de Classificador. O modelo foi treinado usando 256 GPUs Nvidia A100 em Amazon Web Services por um total de 150.000 horas de GPU, a um custo de US$ 600.000.

Limitações

O Stable Diffusion tem limitações conhecidas, incluindo dificuldade com cenas complexas, imprecisões anatômicas (por exemplo, mãos) e vieses nos dados de treinamento. Ele também pode gerar imagens que refletem vieses sociais presentes no conjunto de dados. O modelo pode ter dificuldades com renderização de texto e detalhes finos, e seu desempenho varia entre diferentes prompts. Em 2024, pesquisas em andamento abordam essas questões por meio de ajuste fino e melhorias arquitetônicas.

Impacto e Adoção

O lançamento público do Stable Diffusion em agosto de 2022 marcou uma mudança significativa na IA generativa, tornando a geração de texto para imagem de alta qualidade acessível a um público amplo. Sua licença de código aberto permitiu que desenvolvedores o integrassem em várias aplicações, desde ferramentas de arte até plataformas educacionais. A eficiência do modelo permitiu que ele rodasse em hardware de consumo, fomentando uma comunidade de amadores e pesquisadores. Este lançamento também gerou discussões sobre direitos autorais, ética e o potencial uso indevido de conteúdo gerado por IA. A Stability AI continuou lançando versões melhoradas, como SD XL e SD 3.0, mantendo sua posição no campo em rápida evolução da inteligência artificial.

Direções Futuras

Versões subsequentes do Stable Diffusion exploraram diferentes arquiteturas, como o Transformer de Fluxo Retificado no SD 3.0, visando melhorar a qualidade e a eficiência. A pesquisa continua na redução de vieses, no aprimoramento da controlabilidade e na integração com outras modalidades. O sucesso do modelo influenciou outros projetos de aprendizado de máquina e contribuiu para o boom mais amplo da IA, com implicações para aprendizado profundo e redes neurais. Em 2025, o Stable Diffusion permanece como um marco na geração de texto para imagem, com desenvolvimento contínuo da comunidade e corporativo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·text-to-image·open-source·deep-learning
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico