Modelos de Difusão - Artigo

Traduzido do inglês

O artigo de 2020 de Jonathan Ho et al. introduziu os Modelos Probabilísticos de Difusão com Denoising (DDPM), uma classe de modelos generativos que aprendem a reverter um processo gradual de adição de ruído. Ele se tornou fundamental para a geração de imagens por IA baseada em difusão.

O artigo de pesquisa de 2020 "Denoising Diffusion Probabilistic Models", de autoria de Jonathan Ho, Ajay Jain e Pieter Abbeel, introduziu um método prático e de alta qualidade para modelagem generativa usando processos de difusão. Com base em trabalhos anteriores em termodinâmica de não equilíbrio de 2015, o artigo propôs uma estrutura específica chamada Modelo Probabilístico de Difusão com Remoção de Ruído (DDPM). Em aprendizado de máquina, modelos de difusão são uma classe de modelos generativos de variáveis latentes que aprendem a produzir novos dados revertendo um processo gradual de adição de ruído. Eles se tornaram centrais para a IA generativa moderna, especialmente para geração de imagens, juntamente com outras abordagens em aprendizado profundo.

A ideia central de um modelo de difusão tem duas partes: um processo de difusão direta que adiciona ruído gradualmente aos dados (até que se assemelhem a ruído gaussiano puro) e um processo de amostragem reversa que aprende a remover ruído, recuperando a distribuição original dos dados. Um modelo treinado pode gerar novas amostras começando com ruído aleatório e removendo o ruído iterativamente. O artigo de 2020 propôs o DDPM, que melhorou métodos anteriores ao introduzir um limite variacional simplificado e uma parametrização específica.

Conceitos e formalismo

Modelos de difusão são uma classe de modelos de variáveis latentes que modelam dados como gerados por um processo de difusão - um passeio aleatório com deriva pelo espaço de pontos de dados possíveis. O processo direto é uma cadeia de Markov que adiciona ruído gaussiano ao longo de T etapas, frequentemente usando um cronograma de constantes β_t. O processo reverso também é uma cadeia de Markov, parametrizada por uma rede neural, que aprende a prever o ruído adicionado em cada etapa. O modelo é treinado usando inferência variacional com uma simples perda de erro quadrático médio.

Uma inovação chave do artigo do DDPM é mostrar que o objetivo de treinamento se simplifica para um termo de erro quadrático médio ponderado que corresponde ao ruído previsto pelo modelo com o ruído real. O artigo também estabeleceu que um objetivo mais simples, sem termos de ponderação adicionais, funciona bem na prática. O modelo de difusão reversa, frequentemente chamado de "espinha dorsal", pode ser qualquer rede, tipicamente uma U-Net ou um transformador. Para imagens, a espinha dorsal é geralmente uma variante de U-Net aplicada iterativamente para remover ruído de amostras de imagem.

Como o DDPM funciona

O processo de difusão direta é definido por uma sequência de níveis de ruído β_1,...,β_T, com α_t = 1 − β_t e ᾱ_t como o produto cumulativo. Em cada etapa t, ruído gaussiano é adicionado à imagem. Uma percepção crítica é que, após t etapas, a imagem ruidosa pode ser expressa diretamente como uma combinação da imagem original e ruído gaussiano, permitindo treinamento eficiente em etapas de tempo aleatórias. O processo reverso então aprende a estimar o ruído que foi adicionado, permitindo a recuperação dos dados originais.

No DDPM, o treinamento envolve selecionar etapas de tempo aleatoriamente e minimizar uma perda que compara a saída da rede de previsão de ruído com o ruído gaussiano real. Durante a amostragem, o modelo começa com ruído gaussiano puro e aplica iterativamente o processo reverso aprendido. O artigo também observou que uma ponderação uniforme mais simples sobre as etapas de tempo funciona melhor, e que os estágios iniciais são mais lentos no processo reverso.

Impacto

O método tornou-se fundamental para muitos modelos de difusão subsequentes. Demonstrou geração de imagens de alta qualidade em conjuntos de dados como CIFAR-10 e LSUN, desafiando as redes adversariais generativas então dominantes. Desde então, modelos de difusão foram amplamente adotados em Generative AI e Machine learning, levando a sistemas comerciais como DALL-E e Stable Diffusion, que combinam modelos de difusão com codificadores de texto e Cross-Attention para geração condicionada por texto. A espinha dorsal é frequentemente um híbrido de transformador e U-net, com alguns modelos usando um Transformer (architecture) como espinha dorsal.

Legado e impacto

O artigo de 2020 catalisou uma mudança no desenvolvimento de Generative AI. Antes dos modelos de difusão, as redes adversariais generativas dominavam a geração de imagens, mas o DDPM as superou em qualidade de amostra e estabilidade de treinamento. Em 2024, modelos de difusão são usados principalmente para tarefas como remoção de ruído de imagens, preenchimento de regiões ausentes, super-resolução, geração de imagens e geração de vídeos. Eles também foram aplicados a outros domínios, incluindo geração de texto, geração de som e aprendizado por reforço.

A abordagem do artigo foi estendida por pesquisas subsequentes, como métodos de amostragem rápida, modelos de difusão latente e sistemas de texto para imagem. Seu sucesso contribuiu para um enorme interesse comercial, com ferramentas que agora estão integradas a produtos de hardware e software. A ponte entre física (termodinâmica de não equilíbrio, movimento browniano) e IA moderna é um testemunho da pesquisa acadêmica.

Ver também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·machine-learning·research-paper·diffusion-models
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico