Modelos de Difusão

Traduzido do inglês

Modelos de difusão são uma classe de modelos generativos que aprendem a reverter um processo de ruído, permitindo a criação de novas amostras de dados. Eles são amplamente utilizados para geração de imagens e vídeos, frequentemente combinados com codificadores de texto para saídas condicionadas por texto.

Modelos de difusão, também conhecidos como modelos generativos baseados em difusão ou modelos generativos baseados em pontuação, são uma classe de modelos generativos de variáveis latentes em aprendizado de máquina. Eles consistem em dois componentes principais: um processo de difusão direta que gradualmente adiciona ruído aos dados, e um processo de amostragem reversa que aprende a remover o ruído. O objetivo é aprender um processo de difusão para um determinado conjunto de dados, de modo que novos elementos possam ser gerados com distribuição semelhante aos dados originais. Um modelo de difusão treinado pode ser amostrado de várias maneiras, com diferentes compensações entre eficiência e qualidade.

Os modelos de difusão foram introduzidos em 2015, baseando-se em técnicas da termodinâmica de não equilíbrio. A ideia central é modelar a distribuição dos dados como uma "nuvem" em um espaço de alta dimensão. Ao adicionar ruído repetidamente, essa nuvem se difunde para fora até se tornar quase indistinguível de uma distribuição gaussiana. Um modelo treinado para aproximadamente reverter essa difusão pode então gerar novas amostras da distribuição original, começando com ruído aleatório e removendo o ruído iterativamente.

Formalismos e Treinamento

Existem vários formalismos equivalentes para modelos de difusão, incluindo cadeias de Markov, modelos probabilísticos de difusão com remoção de ruído (DDPM), redes de pontuação condicionadas a ruído e equações diferenciais estocásticas. Eles são tipicamente treinados usando inferência variacional. O modelo responsável pela remoção de ruído é chamado de "backbone", que pode ser qualquer arquitetura, mas comumente é uma U-Net ou um transformador. O artigo DDPM de 2020 melhorou métodos anteriores ao aplicar inferência variacional ao processo de difusão.

Aplicações em Visão Computacional

Em 2024, os modelos de difusão são usados principalmente para tarefas de visão computacional, incluindo remoção de ruído de imagens, preenchimento de regiões ausentes, super-resolução, geração de imagens e geração de vídeos. Essas tarefas geralmente envolvem treinar uma rede neural para remover sequencialmente o ruído de imagens desfocadas com ruído gaussiano. Após o treinamento até a convergência, o modelo pode gerar imagens começando com ruído aleatório e aplicando a rede iterativamente para remover o ruído. Os geradores de imagens baseados em difusão têm visto interesse comercial generalizado, com exemplos notáveis incluindo Stable Diffusion e DALL-E. Esses sistemas frequentemente combinam modelos de difusão com codificadores de texto e módulos de atenção cruzada para permitir a geração condicionada a texto.

Outros Domínios

Além da visão computacional, os modelos de difusão encontraram aplicações em processamento de linguagem natural, como geração de texto e sumarização, bem como em geração de som e aprendizado por reforço. Sua versatilidade os tornou uma área-chave de pesquisa em IA generativa.

Relação com Outros Modelos Generativos

Os modelos de difusão fazem parte de um panorama mais amplo de modelos generativos, que também inclui modelos de linguagem de grande escala e outras abordagens. Enquanto os modelos de linguagem de grande escala geralmente dependem de arquiteturas autorregressivas ou baseadas em transformadores, os modelos de difusão oferecem um paradigma alternativo que é particularmente eficaz para dados contínuos, como imagens e áudio. A escolha do backbone, seja uma U-Net ou um transformador, permite que os modelos de difusão aproveitem avanços em aprendizado profundo e redes neurais.

Direções Futuras

A pesquisa continua a melhorar a eficiência e a qualidade dos modelos de difusão, explorando novos métodos de amostragem, arquiteturas de backbone e aplicações. A integração de modelos de difusão com outros sistemas de IA, como os desenvolvidos por OpenAI, Google DeepMind e Anthropic, provavelmente impulsionará mais inovação em inteligência artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·machine-learning·deep-learning·computer-vision
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico