El artículo de investigación de 2020 "Denoising Diffusion Probabilistic Models", escrito por Jonathan Ho, Ajay Jain y Pieter Abbeel, introdujo un método práctico y de alta calidad para el modelado generativo mediante procesos de difusión. Basándose en trabajos anteriores sobre termodinámica de no equilibrio de 2015, el artículo propuso un marco específico llamado Modelo de Difusión Probabilística de Denoising (DDPM). En el aprendizaje automático, los modelos de difusión son una clase de modelos generativos de variables latentes que aprenden a producir nuevos datos invirtiendo un proceso gradual de añadido de ruido. Se han convertido en un elemento central de la IA generativa moderna, especialmente para la generación de imágenes, junto con otros enfoques en el aprendizaje profundo.
La idea central de un modelo de difusión tiene dos partes: un proceso de difusión directo que añade ruido gradualmente a los datos (hasta que se asemejan a ruido gaussiano puro) y un proceso de muestreo inverso que aprende a eliminar el ruido, recuperando la distribución de datos original. Un modelo entrenado puede generar nuevas muestras comenzando desde ruido aleatorio y aplicando denoising iterativamente. El artículo de 2020 propuso el DDPM, que mejoró métodos anteriores al introducir un límite variacional simplificado y una parametrización específica.
Conceptos y formalismo
Los modelos de difusión son una clase de modelos de variables latentes que modelan los datos como generados por un proceso de difusión - un paseo aleatorio con deriva a través del espacio de posibles puntos de datos. El proceso directo es una cadena de Markov que añade ruido gaussiano en T pasos, a menudo usando un programa de constantes β_t. El proceso inverso también es una cadena de Markov, parametrizada por una red neuronal, que aprende a predecir el ruido añadido en cada paso. El modelo se entrena usando inferencia variacional con una pérdida simple de error cuadrático medio.
Una innovación clave del artículo DDPM es mostrar que el objetivo de entrenamiento se simplifica a un término de error cuadrático medio ponderado que compara el ruido predicho por el modelo con el ruido real. El artículo también estableció que un objetivo más simple sin términos de ponderación adicionales funciona bien en la práctica. El modelo de difusión inversa, a menudo llamado el "backbone", puede ser cualquier red, típicamente un U-Net o un transformador. Para imágenes, el backbone suele ser una variante de U-Net aplicada iterativamente para denoising de muestras de imagen.
Cómo funciona el DDPM
El proceso de difusión directo se define mediante una secuencia de niveles de ruido β_1,...,β_T, con α_t = 1 − β_t y ᾱ_t como el producto acumulativo. En cada paso t, se añade ruido gaussiano a la imagen. Una idea crítica es que después de t pasos, la imagen ruidosa puede expresarse directamente como una combinación de la imagen original y ruido gaussiano, lo que permite un entrenamiento eficiente en pasos de tiempo aleatorios. El proceso inverso aprende entonces a estimar el ruido que se añadió, permitiendo la recuperación de los datos originales.
En el DDPM, el entrenamiento implica seleccionar pasos de tiempo aleatorios y minimizar una pérdida que compara la salida de la red de predicción de ruido con el ruido gaussiano real. Durante el muestreo, el modelo comienza con ruido gaussiano puro y aplica iterativamente el proceso inverso aprendido. El artículo también señaló que una ponderación uniforme más simple sobre los pasos de tiempo funciona mejor, y que las etapas iniciales son más lentas en el proceso inverso.
Impacto
El método se volvió fundamental para muchos modelos de difusión posteriores. Demostró generación de imágenes de alta calidad en conjuntos de datos como CIFAR-10 y LSUN, desafiando a las redes generativas adversariales, que entonces dominaban. Desde entonces, los modelos de difusión han sido ampliamente adoptados en Generative AI y Machine learning, dando lugar a sistemas comerciales como DALL-E y Stable Diffusion, que combinan modelos de difusión con codificadores de texto y Cross-Attention para la generación condicionada por texto. El backbone suele ser un híbrido de transformador y U-net, con algunos modelos que usan un Transformer (architecture) como backbone.
Legado e impacto
El artículo de 2020 catalizó un cambio en el desarrollo de Generative AI. Antes de los modelos de difusión, las redes generativas adversariales dominaban la generación de imágenes, pero el DDPM las superó en calidad de muestra y estabilidad de entrenamiento. A partir de 2024, los modelos de difusión se usan principalmente para tareas como denoising de imágenes, inpainting, superresolución, generación de imágenes y generación de video. También se han aplicado a otros dominios, incluida la generación de texto, generación de sonido y aprendizaje por refuerzo.
El enfoque del artículo ha sido extendido por investigaciones posteriores, como métodos de muestreo rápido, modelos de difusión latente y sistemas de texto a imagen. Su éxito contribuyó a un interés comercial masivo, con herramientas que ahora están integradas en productos de hardware y software. El puente entre la física (termodinámica de no equilibrio, movimiento browniano) y la IA moderna es un testimonio de la investigación académica.