## Estabilidade da Difusão **Stable Diffusion** é um [[modelo de difusão latente|modelo de difusão latente]] de [[texto para imagem|texto para imagem]] que gera imagens a partir de descrições em text

Traduzido do inglês

Um modelo de difusão latente de código aberto para geração de texto para imagem, lançado publicamente em agosto de 2022 pela Stability AI com colaboradores acadêmicos, cuja abertura catalisou um grande ecossistema de ajustes finos da comunidade e ferramentas criativas.

Stable Diffusion é um modelo de geração de texto para imagem lançado publicamente em 22 de agosto de 2022, desenvolvido por pesquisadores do grupo CompVis da Universidade Ludwig Maximilian de Munique em colaboração com a Stability AI e a Runway, com base em trabalhos acadêmicos anteriores sobre modelos de difusão latente. Seu lançamento como um modelo de pesos abertos, em contraste com concorrentes fechados, tornou-o um dos lançamentos mais consequentes na história inicial da IA generativa de imagens mainstream.

Abordagem técnica

Stable Diffusion é construído sobre a técnica de modelo de difusão de aprender a reverter um processo gradual de adição de ruído, mas, de forma distinta, realiza esse processo em um espaço latente comprimido, em vez de diretamente nos pixels, uma abordagem descrita no artigo "High-Resolution Image Synthesis with Latent Diffusion Models", coautorado por Robin Rombach. Operar no espaço latente reduziu substancialmente o custo computacional de treinar e executar o modelo em comparação com a difusão no espaço de pixels, tornando-o prático para rodar em uma única GPU de consumo, um fator-chave em sua rápida adoção. O condicionamento por texto foi fornecido usando um codificador de texto derivado do CLIP, permitindo que o modelo gerasse imagens correspondentes a um prompt em linguagem natural.

Lançamento e abertura

A Stability AI, liderada na época por Emad Mostaque, financiou o poder computacional para o treinamento e lançou publicamente os pesos do modelo sob uma licença permissiva (CreativeML Open RAIL-M), juntamente com código que qualquer pessoa poderia executar localmente. Isso foi um contraste deliberado com a abordagem de API fechada adotada pelo OpenAI com o DALL-E e, posteriormente, pelo Midjourney. Os dados de treinamento foram extraídos substancialmente do conjunto de dados LAION-5B, montado pela organização sem fins lucrativos LAION, uma grande coleção de pares de imagem-texto coletados da web, que mais tarde se tornou uma fonte de controvérsia sobre conteúdo protegido por direitos autorais e, em um pequeno subconjunto, conteúdo ilegal que a LAION trabalhou para identificar e remover.

Ecossistema

O lançamento aberto do Stable Diffusion desencadeou um ecossistema comunitário excepcionalmente grande e de rápida evolução. Em poucos meses, desenvolvedores criaram interfaces de usuário personalizadas, extensões e pipelines de treinamento, e a licença de pesos abertos permitiu uma onda de checkpoints treinados pela comunidade e ajustes finos específicos de estilo distribuídos em plataformas como Hugging Face e Civitai. Técnicas como adaptadores LoRA e ControlNet, que permitiam condicionamento preciso em poses, bordas e mapas de profundidade, foram desenvolvidas pela comunidade e rapidamente incorporadas aos fluxos de trabalho mainstream, estendendo as capacidades práticas do modelo muito além de seu lançamento original. Versões oficiais sucessivas (SD 2.0, SDXL, SD3) melhoraram a qualidade da imagem e a aderência ao prompt, embora algumas atualizações, particularmente a filtragem mais restritiva de dados de treinamento do SD 2.0, tenham gerado reação da comunidade por degradarem certas capacidades.

Recepção e impacto

Stable Diffusion é amplamente creditado por democratizar o acesso à geração de imagens de alta qualidade e por acelerar o debate público sobre IA e direitos autorais, já que sua capacidade de rodar localmente tornou muito mais difícil policiá-lo do que concorrentes com API fechada. Também intensificou o escrutínio sobre o consentimento nos dados de treinamento, contribuindo para processos judiciais de artistas e empresas de imagens de banco, incluindo a Getty Images. As fortunas comerciais da própria Stability AI se mostraram turbulentas, com Mostaque deixando o cargo de CEO em 2024 em meio a pressões de financiamento, mesmo enquanto o modelo subjacente e seus derivados abertos continuaram a ser amplamente usados e permaneceram influentes em relação a entrantes abertos posteriores, como o Flux.

Categorias:generative-ai·image-generation·open-weights
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico