Modelo de difusão discreto

Traduzido do inglês

Um modelo de difusão discreta é um método de IA generativa que corrompe progressivamente dados discretos (como texto ou tokens categóricos) com ruído e aprende a reverter o processo, permitindo a geração de amostras de alta qualidade.

Um modelo de difusão discreto é uma classe de modelo generativo que opera em dados com estados discretos, como tokens de texto, variáveis categóricas ou imagens quantizadas. Diferentemente dos modelos de difusão contínuos, que adicionam ruído gaussiano a dados de valor real, os modelos de difusão discretos aplicam processos de corrupção estruturados - como mascaramento aleatório de tokens ou probabilidades de transição - e aprendem a reverter esses passos para gerar novas amostras. Essa abordagem tornou-se uma alternativa proeminente aos modelos autorregressivos em domínios como modelagem de linguagem e geração de imagens discretas.

O conceito baseia-se na estrutura mais ampla dos modelos de difusão, que foram formalizados pela primeira vez para dados contínuos no início da década de 2010 e ganharam destaque com a introdução dos modelos probabilísticos de difusão com remoção de ruído (DDPMs) em 2015. Variantes discretas foram desenvolvidas para lidar com dados inerentemente discretos sem exigir embeddings contínuos, levando a métodos como difusão multinomial e difusão baseada em máscara. Esses modelos foram adotados por grandes grupos de pesquisa em IA, incluindo OpenAI e Google DeepMind, para tarefas que vão desde geração de texto até design de sequências de proteínas.

Fundamentação Matemática

Os modelos de difusão discretos definem um processo direto que corrompe gradualmente um ponto de dados discreto \(x_0\) em um estado ruidoso \(x_t\) ao longo de passos de tempo \(t = 1, \dots, T\). A corrupção é tipicamente modelada como uma cadeia de Markov com matrizes de transição \(Q_t\), onde cada entrada \([Q_t]_{ij}\) representa a probabilidade de transição do estado \(i\) para o estado \(j\). Escolhas comuns incluem transições uniformes (onde cada token torna-se igualmente provável) ou estados absorventes (onde tokens são substituídos por um token de máscara especial).

O processo reverso é parametrizado por uma rede neural, frequentemente um transformer ou U-Net, que aprende a prever a distribuição de dados original dada uma amostra ruidosa. O treinamento minimiza um limite variacional na log-verossimilhança negativa, similar à difusão contínua, mas com perdas categóricas discretas. Uma vantagem chave é que o processo direto pode ser calculado em forma fechada, permitindo treinamento eficiente sem simular cada passo.

Principais Variantes

Várias arquiteturas de difusão discreta foram propostas. A difusão multinomial, introduzida por pesquisadores da Berkeley AI Research em 2021, usa distribuições categóricas e matrizes de transição uniformes. A difusão baseada em máscara, como o modelo MaskGIT, emprega um processo de estado absorvente onde tokens são progressivamente desmascarados durante a geração. Trabalhos mais recentes, como a estrutura D3PM (Modelos Probabilísticos de Difusão com Remoção de Ruído Discretos), generalizam essas abordagens ao permitir matrizes de transição aprendidas que podem capturar estruturas específicas de domínio, como adjacência em grafos ou similaridade semântica em texto.

Para modelagem de linguagem, modelos de difusão discretos foram integrados em sistemas de grande escala. Por exemplo, o modelo CDCD (Difusão Discreta em Tempo Contínuo) do Google DeepMind e o trabalho posterior da OpenAI em modelos de linguagem por difusão demonstraram desempenho competitivo com transformers autorregressivos em benchmarks como perplexidade de modelagem de linguagem e qualidade de geração de texto. Esses modelos frequentemente usam codificações posicionais e atenção multi-cabeça como componentes centrais.

Aplicações

Os modelos de difusão discretos são usados em uma variedade de tarefas generativas. No processamento de linguagem natural, eles permitem geração de texto não autorregressiva, que pode ser mais rápida que a decodificação sequencial porque todos os tokens são gerados em paralelo. Isso é particularmente útil para tradução automática e sumarização de texto, onde a latência importa. Em visão computacional, a difusão discreta foi aplicada para gerar imagens com valores de pixel discretos ou códigos latentes quantizados, frequentemente alcançando qualidade comparável aos modelos contínuos enquanto sendo mais interpretável.

Além de texto e imagens, modelos de difusão discretos são empregados em bioinformática para gerar sequências de proteínas e em descoberta de fármacos para projetar grafos moleculares. Eles também aparecem em aprendizado por reforço para planejamento e geração de políticas. A adoção na indústria inclui uso em serviços de IA da Amazon Web Services e Microsoft Azure, onde alimentam recursos generativos em plataformas de nuvem.

Comparação com Modelos Autorregressivos

Modelos autorregressivos tradicionais, como transformers estilo GPT, geram dados token por token em uma ordem fixa, o que é simples, mas sequencial. Modelos de difusão discretos, em contraste, podem gerar todos os tokens simultaneamente, oferecendo potenciais ganhos de velocidade em hardware paralelo como AWS Trainium ou aceleradores Groq. No entanto, eles frequentemente exigem objetivos de treinamento mais sofisticados e podem produzir amostras de qualidade ligeiramente inferior em certas tarefas. Pesquisas recentes reduziram essa lacuna, com modelos de linguagem por difusão alcançando quase paridade em benchmarks como GLUE e SuperGLUE.

Outra distinção está na controlabilidade. Modelos de difusão permitem condicionamento flexível durante o processo reverso, possibilitando tarefas como preenchimento de lacunas ou geração guiada sem retreinamento. Isso os torna atraentes para aplicações interativas, como conclusão de código ou IA conversacional.

Desafios e Direções Futuras

Apesar de sua promessa, os modelos de difusão discretos enfrentam desafios. O treinamento pode ser computacionalmente intensivo devido à necessidade de muitos passos reversos, embora métodos recentes como destilação progressiva reduzam esse custo. A qualidade da amostragem pode degradar com sequências longas, e lidar com saídas de comprimento variável permanece um problema em aberto. Pesquisadores também estão explorando abordagens híbridas que combinam difusão discreta com RLHF para alinhar saídas com preferências humanas.

Direções futuras incluem escalar modelos de difusão discretos para tamanhos de trilhões de parâmetros, integrá-los com mecanismos de recuperação e desenvolver matrizes de transição mais eficientes. Em 2025, a difusão discreta permanece uma área ativa de pesquisa, com contribuições de laboratórios acadêmicos como Stanford AI Lab e MIT CSAIL, bem como equipes industriais na Anthropic e Meta. Espera-se que a abordagem complemente, em vez de substituir, modelos autorregressivos no panorama mais amplo da IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·machine-learning·deep-learning·natural-language-processing
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico