Los modelos de difusión, también conocidos como modelos generativos basados en difusión o modelos generativos basados en puntuaciones, son una clase de modelos generativos de variables latentes en aprendizaje automático. Constan de dos componentes principales: un proceso de difusión directa que añade ruido gradualmente a los datos, y un proceso de muestreo inverso que aprende a eliminar el ruido. El objetivo es aprender un proceso de difusión para un conjunto de datos dado, de modo que se puedan generar nuevos elementos distribuidos de manera similar a los datos originales. Un modelo de difusión entrenado puede muestrearse de diversas formas, con diferentes compensaciones entre eficiencia y calidad.
Los modelos de difusión se introdujeron en 2015, basándose en técnicas de termodinámica de no equilibrio. La idea central es modelar la distribución de los datos como una "nube" en un espacio de alta dimensión. Al añadir ruido repetidamente, esta nube se difunde hacia afuera hasta volverse casi indistinguible de una distribución gaussiana. Un modelo entrenado para revertir aproximadamente esta difusión puede entonces generar nuevas muestras de la distribución original, comenzando con ruido aleatorio y eliminando el ruido de manera iterativa.
Formalismos y Entrenamiento
Existen varios formalismos equivalentes para los modelos de difusión, incluyendo cadenas de Markov, modelos probabilísticos de difusión con eliminación de ruido (DDPM), redes de puntuación condicionadas por ruido y ecuaciones diferenciales estocásticas. Generalmente se entrenan mediante inferencia variacional. El modelo responsable de eliminar el ruido se denomina "columna vertebral", que puede ser cualquier arquitectura, aunque comúnmente es una U-Net o un transformador. El artículo DDPM de 2020 mejoró métodos anteriores al aplicar inferencia variacional al proceso de difusión.
Aplicaciones en Visión por Computadora
A partir de 2024, los modelos de difusión se utilizan principalmente para tareas de visión por computadora, incluyendo eliminación de ruido de imágenes, relleno de regiones faltantes, superresolución, generación de imágenes y generación de video. Estas tareas suelen implicar entrenar una red neuronal para eliminar secuencialmente el ruido de imágenes difuminadas con ruido gaussiano. Tras entrenar hasta la convergencia, el modelo puede generar imágenes comenzando con ruido aleatorio y aplicando la red de manera iterativa para eliminar el ruido. Los generadores de imágenes basados en difusión han despertado un gran interés comercial, con ejemplos notables como Stable Diffusion y DALL-E. Estos sistemas a menudo combinan modelos de difusión con codificadores de texto y módulos de atención cruzada para permitir la generación condicionada por texto.
Otros Dominios
Más allá de la visión por computadora, los modelos de difusión han encontrado aplicaciones en el procesamiento del lenguaje natural, como la generación y el resumen de texto, así como en la generación de sonido y el aprendizaje por refuerzo. Su versatilidad los ha convertido en un área clave de investigación en IA generativa.
Relación con Otros Modelos Generativos
Los modelos de difusión forman parte de un panorama más amplio de modelos generativos, que también incluye modelos de lenguaje grandes y otros enfoques. Mientras que los modelos de lenguaje grandes suelen depender de arquitecturas autorregresivas o basadas en transformadores, los modelos de difusión ofrecen un paradigma alternativo que es particularmente efectivo para datos continuos como imágenes y audio. La elección de la columna vertebral, ya sea una U-Net o un transformador, permite que los modelos de difusión aprovechen los avances en aprendizaje profundo y redes neuronales.
Direcciones Futuras
La investigación continúa mejorando la eficiencia y la calidad de los modelos de difusión, explorando nuevos métodos de muestreo, arquitecturas de columna vertebral y aplicaciones. La integración de los modelos de difusión con otros sistemas de IA, como los desarrollados por OpenAI, Google DeepMind y Anthropic, probablemente impulsará una mayor innovación en inteligencia artificial.