Difusión latente

Traducido del inglés

Los modelos de difusión latente (LDMs) son una arquitectura de modelo de difusión que realiza la eliminación de ruido en un espacio latente comprimido, lo que permite una generación eficiente de imágenes de alta resolución. Desarrollados por el grupo CompVis de la LMU de Múnich, los LDMs sustentan las versiones 1.1 a 2.1 de Stable Diffusion.

El modelo de difusión latente (LDM) es una arquitectura de modelo de difusión desarrollada por el grupo Computer Vision & Learning (CompVis) de la LMU de Múnich. Mejora los modelos de difusión estándar al realizar el proceso de difusión en un espacio latente de menor dimensión en lugar de directamente en el espacio de píxeles, lo que reduce el costo computacional y permite una generación más eficiente de imágenes de alta resolución. Los LDM también incorporan condicionamiento por autoatención y atención cruzada, lo que permite un control flexible sobre la salida generada basada en texto, imágenes u otras modalidades.

Los modelos de difusión se introdujeron en 2015 como una clase de modelos generativos que aprenden a revertir un proceso gradual de añadido de ruido. La arquitectura LDM se publicó en arXiv el 20 de diciembre de 2021, y tanto los repositorios de Stable Diffusion como de LDM se lanzaron en GitHub. Los LDM se utilizan ampliamente en modelos de difusión prácticos; por ejemplo, las versiones 1.1 a 2.1 de Stable Diffusion se basaron en la arquitectura LDM.

Arquitectura

El LDM consta de tres componentes principales: un autoencoder variacional (VAE), un U-Net modificado y un codificador de texto. El codificador del VAE comprime una imagen de entrada del espacio de píxeles a un espacio latente más pequeño, capturando el significado semántico mientras reduce la dimensionalidad. Se aplica ruido gaussiano de forma iterativa a esta representación latente comprimida durante la difusión directa. El U-Net, construido sobre una base ResNet, elimina el ruido de la representación latente mediante un proceso inverso. Finalmente, el decodificador del VAE convierte el latente sin ruido de vuelta al espacio de píxeles para producir la imagen final.

El paso de eliminación de ruido puede condicionarse con texto, imágenes u otras modalidades. Para el condicionamiento por texto, un codificador de texto CLIP ViT-L/14 preentrenado transforma las indicaciones de texto en un espacio de incrustaciones, que luego se expone al U-Net mediante un mecanismo de atención cruzada. Esto permite que el modelo genere imágenes que se alineen con la descripción textual proporcionada.

Autoencoder Variacional

El VAE se entrena primero en un conjunto de datos de imágenes. Su codificador toma una imagen como entrada y genera una representación latente de menor dimensión, que sirve como entrada al U-Net. Después del entrenamiento, el codificador se utiliza para comprimir imágenes, y el decodificador reconstruye imágenes a partir de representaciones latentes.

En la versión implementada, el codificador es una red neuronal convolucional (CNN) con un único mecanismo de autoatención cerca del final. Toma un tensor de forma (3, H, W) y genera un tensor de forma (8, H/8, W/8), que concatena la media y la varianza predichas del vector latente, cada una de forma (4, H/8, W/8). Durante el entrenamiento, se utiliza la varianza, pero en la inferencia normalmente solo se retiene la media. El decodificador también es una CNN con un único mecanismo de autoatención, que mapea un tensor de (4, H/8, W/8) de vuelta a (3, H, W).

U-Net

La base del U-Net procesa varias entradas: una matriz de imagen latente del codificador del VAE, una incrustación de paso de tiempo que indica el nivel de ruido actual e incrustaciones de condicionamiento del codificador de texto. El U-Net se entrena para predecir el ruido que se añadió a la representación latente, lo que le permite eliminar el ruido de forma iterativa. La arquitectura incorpora bloques residuales y capas de atención, lo que le permite manejar tanto el contexto local como el global.

Entrenamiento y Condicionamiento

Los LDM se entrenan con un objetivo de eliminación de ruido: dado un latente ruidoso, el modelo aprende a predecir el ruido original. El proceso de entrenamiento utiliza una función de pérdida que mide la diferencia entre el ruido predicho y el real. El condicionamiento se integra a través de capas de atención cruzada, donde la incrustación de texto se utiliza para modular el proceso de eliminación de ruido. Este enfoque admite la guía sin clasificador, donde el modelo se entrena tanto con como sin condicionamiento, y en la inferencia el condicionamiento se amplifica para mejorar la adherencia a la indicación.

Aplicaciones e Impacto

Los LDM se han convertido en una arquitectura fundamental para la generación de texto a imagen. Stable Diffusion, un modelo de código abierto prominente, utiliza la arquitectura LDM. Las versiones 1.1 a 1.4 fueron lanzadas por CompVis en agosto de 2022, con cada versión ajustada finamente en imágenes progresivamente más estéticas. Stable Diffusion 1.5, lanzado por RunwayML en octubre de 2022, incorporó un 10% de abandono del condicionamiento de texto para mejorar la guía sin clasificador. La eficiencia de la difusión en el espacio latente ha hecho posible ejecutar estos modelos en hardware de consumo, democratizando el acceso a la IA generativa.

Desarrollos Relacionados

Los modelos de difusión evolucionaron a partir de trabajos anteriores sobre termodinámica de no equilibrio. Un artículo de 2019 introdujo la red de puntuación condicional de ruido (NCSN), también conocida como emparejamiento de puntuaciones con dinámica de Langevin (SMLD), con una implementación en PyTorch. Un artículo de 2020 propuso el modelo probabilístico de difusión de eliminación de ruido (DDPM), que mejoró el entrenamiento mediante inferencia variacional y se lanzó en TensorFlow. El LDM se basa en estos fundamentos al trasladar el proceso de difusión a un espacio latente, una innovación clave que reduce los requisitos de memoria y cómputo mientras mantiene una alta calidad de salida.

Los LDM forman parte del campo más amplio de la IA generativa, que también incluye los modelos de lenguaje grandes y otras arquitecturas de aprendizaje profundo. El uso de atención cruzada y bases U-Net conecta los LDM con avances en el diseño de redes neuronales. A partir de 2025, la difusión latente sigue siendo un enfoque estándar en sistemas de generación de imágenes comerciales y de código abierto, con investigación en curso centrada en mejorar la eficiencia, el control y la fidelidad.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·diffusion-models·deep-learning·image-generation
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial