Stable Diffusion es un modelo de aprendizaje profundo de texto a imagen, lanzado en agosto de 2022, desarrollado por investigadores del grupo CompVis de la LMU de Múnich y Runway, con apoyo computacional de Stability AI y datos de entrenamiento de organizaciones sin fines de lucro. Es un modelo de difusión latente, un tipo de red neuronal artificial generativa profunda, y se considera un producto destacado de Stability AI, contribuyendo al auge actual de la IA. El código y los pesos del modelo se publicaron públicamente, lo que permite ejecutarlo en hardware de consumo con GPUs modestas (tan solo 2,4 GB de VRAM), a diferencia de modelos propietarios como DALL-E y Midjourney, que solo eran accesibles mediante servicios en la nube.
El caso de uso principal es generar imágenes detalladas condicionadas por descripciones de texto, pero también admite tareas como inpainting, outpainting y traducción de imagen a imagen guiada por indicaciones de texto. Su naturaleza de código abierto y su eficiencia llevaron a una adopción rápida en diversas aplicaciones, desde el arte digital hasta la investigación.
Desarrollo
Stable Diffusion se originó a partir de un proyecto llamado difusión latente, desarrollado en Alemania por investigadores de la LMU de Múnich y la Universidad de Heidelberg. Cuatro de los cinco autores originales (Robin Rombach, Andreas Blattmann, Patrick Esser y Dominik Lorenz) se unieron posteriormente a Stability AI y lanzaron versiones subsiguientes. La licencia técnica fue publicada por el grupo CompVis de la LMU de Múnich. El desarrollo fue liderado por Patrick Esser de Runway y Robin Rombach de CompVis, quienes estuvieron entre los inventores de la arquitectura de difusión latente. Stability AI también acreditó a EleutherAI y LAION, una organización alemana sin fines de lucro que ensambló el conjunto de datos de entrenamiento, como partidarios.
Tecnología
Arquitectura
Los modelos de difusión, introducidos en 2015, se entrenan para eliminar aplicaciones sucesivas de ruido gaussiano en imágenes de entrenamiento, funcionando como una secuencia de autoencoders de denoising. El nombre deriva de la difusión termodinámica, ya que se inspiraron en la termodinámica. Stable Diffusion utiliza una variante llamada modelo de difusión latente (LDM), desarrollado en 2021 por el grupo CompVis.
El modelo consta de tres partes: un autoencoder variacional (VAE), una U-Net y un codificador de texto opcional. El codificador VAE comprime las imágenes del espacio de píxeles a un espacio latente más pequeño, capturando el significado semántico. Se aplica ruido gaussiano iterativamente a la representación latente comprimida durante la difusión directa. La U-Net, compuesta por un backbone ResNet, elimina el ruido de la salida para obtener una representación latente. Finalmente, el decodificador VAE genera la imagen final convirtiendo la representación de nuevo al espacio de píxeles.
El paso de denoising puede condicionarse a texto, imágenes u otras modalidades mediante un mecanismo de atención cruzada. Para el condicionamiento por texto, un codificador de texto CLIP ViT-L/14 fijo y preentrenado transforma las indicaciones en un espacio de incrustaciones. Los LDM ofrecen una mayor eficiencia computacional para el entrenamiento y la generación. Con 860 millones de parámetros en la U-Net y 123 millones en el codificador de texto, Stable Diffusion es relativamente ligero según los estándares de 2022, capaz de ejecutarse en GPUs de consumo e incluso solo con CPU mediante la versión OpenVINO.
SD XL
La versión XL utiliza la misma arquitectura LDM pero más grande: un backbone UNet más grande, un contexto de atención cruzada más amplio, dos codificadores de texto en lugar de uno y entrenamiento en múltiples relaciones de aspecto. El SD XL Refiner, lanzado simultáneamente, tiene la misma arquitectura pero se entrenó para añadir detalles finos a imágenes existentes mediante img2img condicionado por texto.
SD 3.0
La versión 3.0 cambia el backbone por completo, utilizando un Rectified Flow Transformer en lugar de una UNet. La arquitectura Transformer tiene tres pistas: codificación de texto original, codificación de texto transformada y codificación de imagen (en espacio latente). La codificación de texto transformada y la codificación de imagen se mezclan durante cada bloque del transformer. Esta arquitectura se denomina "transformador de difusión multimodal (MMDiT)", donde "multimodal" significa que mezcla codificaciones de texto e imagen dentro de sus operaciones, diferenciándose de versiones DiT anteriores donde la codificación de texto solo afectaba a la codificación de imagen.
Datos de Entrenamiento
Stable Diffusion se entrenó en pares de imagen y leyenda de LAION-5B, un conjunto de datos disponible públicamente derivado de datos de Common Crawl, que contiene 5 mil millones de pares de imagen y texto filtrados por idioma, resolución, probabilidad de marca de agua y puntuación estética predicha. El conjunto de datos fue creado por LAION, una organización alemana sin fines de lucro financiada por Stability AI. El modelo se entrenó en tres subconjuntos: laion2B-en, laion-high-resolution y laion-aesthetics v2 5+. Un análisis de terceros de un subconjunto más pequeño de 12 millones de imágenes encontró que aproximadamente el 47% provenía de 100 dominios diferentes, con Pinterest ocupando el 8,5%, seguido de WordPress, Blogspot, Flickr, DeviantArt y Wikimedia Commons. Una investigación de Bayerischer Rundfunk reveló que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles.
Procedimientos de Entrenamiento
El modelo se entrenó inicialmente en laion2B-en y laion-high-resolution, con rondas finales en LAION-Aesthetics v2 5+, un subconjunto de 600 millones de imágenes con leyendas que se predijo que recibirían una puntuación de al menos 5 sobre 10 por calidad estética. Este subconjunto excluyó imágenes de baja resolución y aquellas con una probabilidad de marca de agua superior al 80%. Las rondas finales de entrenamiento redujeron el 10% del condicionamiento por texto para mejorar la Guía de Difusión Sin Clasificador. El modelo se entrenó utilizando 256 GPUs Nvidia A100 en Amazon Web Services durante un total de 150.000 horas de GPU, con un costo de 600.000 dólares.
Limitaciones
Stable Diffusion tiene limitaciones conocidas, incluida la dificultad con escenas complejas, imprecisiones anatómicas (por ejemplo, manos) y sesgos en los datos de entrenamiento. También puede generar imágenes que reflejan sesgos sociales presentes en el conjunto de datos. El modelo puede tener dificultades con la representación de texto y detalles finos, y su rendimiento varía según las diferentes indicaciones. A partir de 2024, la investigación en curso aborda estos problemas mediante ajuste fino y mejoras arquitectónicas.
Impacto y Adopción
La publicación pública de Stable Diffusion en agosto de 2022 marcó un cambio significativo en la IA generativa, haciendo accesible la generación de texto a imagen de alta calidad a una amplia audiencia. Su licencia de código abierto permitió a los desarrolladores integrarlo en diversas aplicaciones, desde herramientas de arte hasta plataformas educativas. La eficiencia del modelo permitió ejecutarlo en hardware de consumo, fomentando una comunidad de aficionados e investigadores. Esta publicación también provocó discusiones sobre derechos de autor, ética y el posible uso indebido del contenido generado por IA. Stability AI continuó lanzando versiones mejoradas, como SD XL y SD 3.0, manteniendo su posición en el campo en rápida evolución de la inteligencia artificial.
Direcciones Futuras
Las versiones posteriores de Stable Diffusion han explorado diferentes arquitecturas, como el Rectified Flow Transformer en SD 3.0, con el objetivo de mejorar la calidad y la eficiencia. La investigación continúa en la reducción de sesgos, la mejora de la controlabilidad y la integración con otras modalidades. El éxito del modelo ha influido en otros proyectos de aprendizaje automático y ha contribuido al auge más amplio de la IA, con implicaciones para el aprendizaje profundo y las redes neuronales. A partir de 2025, Stable Diffusion sigue siendo un punto de referencia en la generación de texto a imagen, con desarrollo continuo tanto comunitario como corporativo.