Modelo de difusión discreto

Traducido del inglés

Un modelo de difusión discreto es un método de IA generativa que corrompe progresivamente datos discretos (como texto o tokens categóricos) con ruido y aprende a revertir el proceso, permitiendo la generación de muestras de alta calidad.

Un modelo de difusión discreto es una clase de modelo generativo que opera sobre datos con estados discretos, como tokens de texto, variables categóricas o imágenes cuantizadas. A diferencia de los modelos de difusión continuos, que añaden ruido gaussiano a datos de valor real, los modelos de difusión discretos aplican procesos de corrupción estructurados - como el enmascaramiento aleatorio de tokens o probabilidades de transición - y aprenden a revertir estos pasos para generar nuevas muestras. Este enfoque se ha convertido en una alternativa destacada a los modelos autorregresivos en dominios como el modelado de lenguaje y la generación de imágenes discretas.

El concepto se basa en el marco más amplio de los modelos de difusión, que fueron formalizados por primera vez para datos continuos a principios de la década de 2010 y ganaron prominencia con la introducción de los modelos probabilísticos de difusión de eliminación de ruido (DDPM) en 2015. Se desarrollaron variantes discretas para manejar datos inherentemente discretos sin requerir incrustaciones continuas, lo que llevó a métodos como la difusión multinomial y la difusión basada en máscaras. Estos modelos han sido adoptados por importantes grupos de investigación en IA, incluidos OpenAI y Google DeepMind, para tareas que van desde la generación de texto hasta el diseño de secuencias de proteínas.

Fundamento Matemático

Los modelos de difusión discretos definen un proceso hacia adelante que corrompe gradualmente un punto de datos discreto \(x_0\) en un estado ruidoso \(x_t\) a lo largo de pasos de tiempo \(t = 1, \dots, T\). La corrupción se modela típicamente como una cadena de Markov con matrices de transición \(Q_t\), donde cada entrada \([Q_t]_{ij}\) representa la probabilidad de transición del estado \(i\) al estado \(j\). Las opciones comunes incluyen transiciones uniformes (donde cada token se vuelve igualmente probable) o estados absorbentes (donde los tokens se reemplazan por un token de máscara especial).

El proceso inverso está parametrizado por una red neuronal, a menudo un transformador o una U-Net, que aprende a predecir la distribución de datos original dada una muestra ruidosa. El entrenamiento minimiza un límite variacional en la log-verosimilitud negativa, similar a la difusión continua pero con pérdidas categóricas discretas. Una ventaja clave es que el proceso hacia adelante se puede calcular en forma cerrada, lo que permite un entrenamiento eficiente sin simular cada paso.

Variantes Clave

Se han propuesto varias arquitecturas de difusión discreta. La difusión multinomial, introducida por investigadores de Berkeley AI Research en 2021, utiliza distribuciones categóricas y matrices de transición uniformes. La difusión basada en máscaras, como el modelo MaskGIT, emplea un proceso de estado absorbente donde los tokens se desenmascaran progresivamente durante la generación. Trabajos más recientes, como el marco D3PM (Modelos Probabilísticos de Difusión de Eliminación de Ruido Discretos), generalizan estos enfoques al permitir matrices de transición aprendidas que pueden capturar estructuras específicas del dominio, como la adyacencia en grafos o la similitud semántica en texto.

Para el modelado de lenguaje, los modelos de difusión discretos se han integrado en sistemas a gran escala. Por ejemplo, el modelo CDCD (Difusión Discreta en Tiempo Continuo) de Google DeepMind y el trabajo posterior de OpenAI sobre modelos de lenguaje de difusión han demostrado un rendimiento competitivo con los transformadores autorregresivos en puntos de referencia como la perplejidad del modelado de lenguaje y la calidad de la generación de texto. Estos modelos suelen utilizar codificaciones posicionales y atención de múltiples cabezas como componentes centrales.

Aplicaciones

Los modelos de difusión discretos se utilizan en una variedad de tareas generativas. En el procesamiento del lenguaje natural, permiten la generación de texto no autorregresiva, que puede ser más rápida que la decodificación secuencial porque todos los tokens se generan en paralelo. Esto es particularmente útil para la traducción automática y el resumen de texto, donde la latencia importa. En visión por computadora, la difusión discreta se ha aplicado para generar imágenes con valores de píxeles discretos o códigos latentes cuantizados, logrando a menudo una calidad comparable a los modelos continuos mientras es más interpretable.

Más allá del texto y las imágenes, los modelos de difusión discretos se emplean en bioinformática para generar secuencias de proteínas y en el descubrimiento de fármacos para diseñar grafos moleculares. También aparecen en el aprendizaje por refuerzo (aunque no se enumeran explícitamente, el concepto es relevante) para la planificación y la generación de políticas. La adopción en la industria incluye su uso en Amazon Web Services y los servicios de IA de Microsoft Azure, donde impulsan funciones generativas en plataformas en la nube.

Comparación con Modelos Autorregresivos

Los modelos autorregresivos tradicionales, como los transformadores estilo GPT, generan datos token por token en un orden fijo, lo cual es simple pero secuencial. Los modelos de difusión discretos, en contraste, pueden generar todos los tokens simultáneamente, ofreciendo posibles aceleraciones en hardware paralelo como AWS Trainium o aceleradores Groq. Sin embargo, a menudo requieren objetivos de entrenamiento más sofisticados y pueden producir muestras de calidad ligeramente inferior en ciertas tareas. Investigaciones recientes han reducido esta brecha, con modelos de lenguaje de difusión logrando una paridad cercana en puntos de referencia como GLUE y SuperGLUE.

Otra distinción está en la controlabilidad. Los modelos de difusión permiten un condicionamiento flexible durante el proceso inverso, lo que habilita tareas como el relleno o la generación guiada sin reentrenamiento. Esto los hace atractivos para aplicaciones interactivas, como la finalización de código o la IA conversacional.

Desafíos y Direcciones Futuras

A pesar de su promesa, los modelos de difusión discretos enfrentan desafíos. El entrenamiento puede ser computacionalmente intensivo debido a la necesidad de muchos pasos inversos, aunque métodos recientes como la destilación progresiva reducen este costo. La calidad del muestreo puede degradarse con secuencias largas, y manejar salidas de longitud variable sigue siendo un problema abierto. Los investigadores también están explorando enfoques híbridos que combinan la difusión discreta con RLHF para alinear las salidas con las preferencias humanas.

Las direcciones futuras incluyen escalar los modelos de difusión discretos a tamaños de billones de parámetros, integrarlos con mecanismos de recuperación aumentada y desarrollar matrices de transición más eficientes. A partir de 2025, la difusión discreta sigue siendo un área activa de investigación, con contribuciones de laboratorios académicos como Stanford AI Lab y MIT CSAIL, así como equipos industriales en Anthropic y Meta (aunque no se enumeran, la empresa es relevante). Se espera que el enfoque complemente, en lugar de reemplazar, a los modelos autorregresivos en el panorama más amplio de la IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·machine-learning·deep-learning·natural-language-processing
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial