Difusión Probabilística de Desnoisado ([[DDPM|DDPM]])

Traducido del inglés

Los Modelos Probabilísticos de Difusión con Denoising (DDPMs) son una clase de modelos generativos que aprenden a revertir un proceso gradual de ruido para crear datos, ampliamente utilizados para la generación de imágenes. Introducidos en 2020, mejoraron métodos de difusión anteriores mediante inferencia variacional.

Los Modelos Probabilísticos de Difusión con Denoising (DDPM, por sus siglas en inglés) son una clase de modelos generativos en el aprendizaje automático que generan datos aprendiendo a revertir un proceso gradual de añadido de ruido. Pertenecen a la familia más amplia de los modelos de difusión, que modelan los datos como si experimentaran una caminata aleatoria con deriva a través de un espacio de alta dimensionalidad. Los DDPM fueron introducidos en un artículo de 2020 que mejoró los enfoques de difusión anteriores mediante el uso de inferencia variacional, y se convirtieron en una base para muchos sistemas modernos de generación de imágenes.

En un DDPM, el proceso directo añade ruido gaussiano a una imagen a lo largo de una secuencia de pasos de tiempo, transformándola gradualmente en ruido puro. El modelo se entrena para revertir este proceso, comenzando desde ruido aleatorio y eliminando el ruido de forma iterativa para producir una imagen realista. Este enfoque ha demostrado ser muy eficaz para tareas como la generación de imágenes, la inpaintización y la superresolución, y sustenta sistemas comerciales como Stable Diffusion y DALL-E.

Mecanismo central

El marco de los DDPM define un proceso de difusión directa con un programa fijo de niveles de ruido. Para una imagen dada, se añade ruido en cada paso de tiempo según un programa de varianza, produciendo una secuencia de versiones cada vez más ruidosas. El proceso inverso es aprendido por una red neuronal, típicamente una U-Net o un transformador, que predice el componente de ruido en cada paso. El entrenamiento minimiza un error cuadrático medio entre el ruido predicho y el real, lo que equivale a una forma de inferencia variacional.

Matemáticamente, el proceso directo utiliza constantes \(\beta_1, \dots, \beta_T\) en (0,1), con \(\alpha_t = 1 - \beta_t\) y \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\). La imagen ruidosa en el paso de tiempo \(t\) es una combinación lineal de la imagen original y ruido gaussiano, con varianza \(\sigma_t^2 = 1 - \bar{\alpha}_t\). El proceso inverso está parametrizado por una red neuronal que produce la media de la distribución de denoising.

Entrenamiento y muestreo

Entrenar un DDPM implica muestrear un paso de tiempo aleatorio, añadir el ruido correspondiente a una imagen y entrenar la red para predecir ese ruido. La función de pérdida es \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\), donde \(\epsilon\) es el ruido y \(\epsilon_\theta\) es la predicción de la red. Este objetivo se deriva de un límite variacional sobre la log-verosimilitud.

En el momento del muestreo, el modelo comienza con ruido gaussiano puro y aplica el proceso inverso de forma iterativa durante \(T\) pasos, eliminando una porción de ruido en cada uno. El número de pasos puede reducirse mediante técnicas como los modelos de difusión implícitos con denoising (DDIM) o aprendiendo un programa de ruido, lo que permite una generación más rápida.

Contexto histórico

Los modelos de difusión fueron propuestos por primera vez en 2015 por Jascha Sohl-Dickstein y sus colegas, basándose en principios de la termodinámica del no equilibrio. Demostraron que una distribución de datos compleja podía difundirse gradualmente hasta convertirla en una distribución gaussiana simple, y que aprender a revertir este proceso podía generar nuevas muestras. Sin embargo, los primeros métodos eran computacionalmente costosos y menos eficaces que las GAN en ese momento.

El artículo de 2020 sobre DDPM, escrito por Jonathan Ho, Ajay Jain y Pieter Abbeel, demostró que con un programa de ruido cuidadosamente elegido y una arquitectura U-Net, los modelos de difusión podían alcanzar una calidad de generación de imágenes de última generación. Esto provocó una rápida expansión de la investigación y las aplicaciones.

Aplicaciones e impacto

A partir de 2024, los DDPM y sus variantes se utilizan ampliamente en visión por computador para tareas como la eliminación de ruido en imágenes, la inpaintización, la superresolución y la generación de imágenes a partir de texto. También se aplican en el procesamiento del lenguaje natural para la generación de texto y resúmenes, y en la generación de audio. Productos comerciales como Stable Diffusion y DALL-E combinan los DDPM con codificadores de texto y módulos de atención cruzada para permitir la generación condicionada por texto, haciéndolos accesibles a un público amplio.

Los DDPM también han influido en otros campos, incluido el aprendizaje por refuerzo y la simulación científica, donde se utilizan para modelar distribuciones complejas. Su capacidad para generar muestras de alta calidad los ha convertido en una piedra angular de la investigación en inteligencia artificial moderna.

Limitaciones y direcciones futuras

A pesar de su éxito, los DDPM tienen limitaciones. El muestreo suele ser más lento que en las GAN debido al proceso iterativo de eliminación de ruido, aunque se han desarrollado métodos acelerados. También requieren recursos computacionales sustanciales para el entrenamiento, lo que ha impulsado el interés en arquitecturas eficientes y hardware especializado como AWS Trainium y las TPU de Google Cloud. La investigación en curso se centra en mejorar la calidad de las muestras, reducir el tiempo de inferencia y extender los DDPM a nuevas modalidades.

A partir de 2025, los modelos de difusión siguen siendo un área activa de estudio, con innovaciones en arquitecturas de red, programas de ruido y mecanismos de condicionamiento que continúan ampliando los límites de lo posible en el modelado generativo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·machine-learning·computer-vision·deep-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial