Traduzido do inglês

Modelos de difusão latente (LDMs) são uma arquitetura de modelo de difusão que realiza a remoção de ruído em um espaço latente comprimido, permitindo a geração eficiente de imagens em alta resolução. Desenvolvidos pelo grupo CompVis da LMU de Munique, os LDMs sustentam as versões 1.1 a 2.1 do Stable Diffusion.

O modelo de difusão latente (LDM) é uma arquitetura de modelo de difusão desenvolvida pelo grupo Computer Vision & Learning (CompVis) da LMU Munique. Ele melhora os modelos de difusão padrão ao realizar o processo de difusão em um espaço latente de menor dimensionalidade, em vez de diretamente no espaço de pixels, o que reduz o custo computacional e permite uma geração mais eficiente de imagens de alta resolução. Os LDMs também incorporam condicionamento por autoatenção e atenção cruzada, permitindo controle flexível sobre a saída gerada com base em texto, imagens ou outras modalidades.

Os modelos de difusão foram introduzidos em 2015 como uma classe de modelos generativos que aprendem a reverter um processo gradual de adição de ruído. A arquitetura LDM foi publicada no arXiv em 20 de dezembro de 2021, e tanto os repositórios Stable Diffusion quanto LDM foram lançados no GitHub. Os LDMs são amplamente utilizados em modelos de difusão práticos; por exemplo, as versões 1.1 a 2.1 do Stable Diffusion foram baseadas na arquitetura LDM.

Arquitetura

O LDM consiste em três componentes principais: um autoencoder variacional (VAE), um U-Net modificado e um codificador de texto. O codificador do VAE comprime uma imagem de entrada do espaço de pixels para um espaço latente menor, capturando o significado semântico enquanto reduz a dimensionalidade. Ruído gaussiano é aplicado iterativamente a essa representação latente comprimida durante a difusão direta. O U-Net, construído sobre uma espinha dorsal ResNet, remove o ruído da representação latente por meio de um processo reverso. Finalmente, o decodificador do VAE converte o latente sem ruído de volta ao espaço de pixels para produzir a imagem final.

A etapa de remoção de ruído pode ser condicionada a texto, imagens ou outras modalidades. Para condicionamento por texto, um codificador de texto CLIP ViT-L/14 pré-treinado transforma prompts de texto em um espaço de incorporação, que é então exposto ao U-Net por meio de um mecanismo de atenção cruzada. Isso permite que o modelo gere imagens que se alinham com a descrição textual fornecida.

Autoencoder Variacional

O VAE é primeiro treinado em um conjunto de dados de imagens. Seu codificador recebe uma imagem como entrada e gera uma representação latente de menor dimensionalidade, que serve como entrada para o U-Net. Após o treinamento, o codificador é usado para comprimir imagens, e o decodificador reconstrói imagens a partir de representações latentes.

Na versão implementada, o codificador é uma rede neural convolucional (CNN) com um único mecanismo de autoatenção próximo ao final. Ele recebe um tensor de forma (3, H, W) e gera um tensor de forma (8, H/8, W/8), que concatena a média e a variância previstas do vetor latente, cada uma com forma (4, H/8, W/8). Durante o treinamento, a variância é usada, mas na inferência normalmente apenas a média é retida. O decodificador também é uma CNN com um único mecanismo de autoatenção, mapeando um tensor (4, H/8, W/8) de volta para (3, H, W).

U-Net

A espinha dorsal U-Net processa várias entradas: uma matriz de imagem latente do codificador do VAE, uma incorporação de passo de tempo indicando o nível atual de ruído e incorporações de condicionamento do codificador de texto. O U-Net é treinado para prever o ruído que foi adicionado à representação latente, permitindo que ele remova o ruído iterativamente. A arquitetura incorpora blocos residuais e camadas de atenção, permitindo que lide com contexto local e global.

Treinamento e Condicionamento

Os LDMs são treinados com um objetivo de remoção de ruído: dado um latente ruidoso, o modelo aprende a prever o ruído original. O processo de treinamento usa uma função de perda que mede a diferença entre o ruído previsto e o real. O condicionamento é integrado por meio de camadas de atenção cruzada, onde a incorporação de texto é usada para modular o processo de remoção de ruído. Essa abordagem suporta orientação sem classificador, onde o modelo é treinado tanto com quanto sem condicionamento, e na inferência o condicionamento é amplificado para melhorar a aderência ao prompt.

Aplicações e Impacto

Os LDMs se tornaram uma arquitetura fundamental para a geração de texto para imagem. O Stable Diffusion, um modelo de código aberto proeminente, usa a arquitetura LDM. As versões 1.1 a 1.4 foram lançadas pela CompVis em agosto de 2022, com cada versão ajustada em imagens progressivamente mais estéticas. O Stable Diffusion 1.5, lançado pela RunwayML em outubro de 2022, incorporou um dropout de 10% do condicionamento de texto para melhorar a orientação sem classificador. A eficiência da difusão em espaço latente tornou possível executar esses modelos em hardware de consumo, democratizando o acesso à IA generativa.

Desenvolvimentos Relacionados

Os modelos de difusão evoluíram de trabalhos anteriores sobre termodinâmica de não equilíbrio. Um artigo de 2019 introduziu a rede de pontuação condicional a ruído (NCSN), também conhecida como correspondência de pontuação com dinâmica de Langevin (SMLD), com uma implementação em PyTorch. Um artigo de 2020 propôs o modelo probabilístico de difusão com remoção de ruído (DDPM), que melhorou o treinamento por meio de inferência variacional e foi lançado em TensorFlow. O LDM se baseia nesses fundamentos ao deslocar o processo de difusão para um espaço latente, uma inovação chave que reduz requisitos de memória e computação enquanto mantém alta qualidade de saída.

Os LDMs fazem parte do campo mais amplo de IA generativa, que também inclui modelos de linguagem de grande porte e outras arquiteturas de aprendizado profundo. O uso de atenção cruzada e espinhas dorsais U-Net conecta os LDMs a avanços no design de redes neurais. Em 2025, a difusão latente permanece uma abordagem padrão em sistemas comerciais e de código aberto de geração de imagens, com pesquisa contínua focada em melhorar eficiência, controlabilidade e fidelidade.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·diffusion-models·deep-learning·image-generation
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico