Stable Diffusion es un modelo de aprendizaje profundo de texto a imagen, lanzado en 2022 por Stability AI, basado en técnicas de difusión. Se utiliza principalmente para generar imágenes detalladas condicionadas por descripciones de texto, aunque también puede aplicarse a tareas como el relleno de imágenes (inpainting), la extrapolación (outpainting) y las traducciones de imagen a imagen guiadas por un prompt de texto. El modelo se considera parte del auge en curso de la IA generativa y marcó un cambio respecto a los modelos de texto a imagen propietarios anteriores, como DALL-E y Midjourney, que solo eran accesibles mediante servicios en la nube.
Stable Diffusion es un modelo de difusión latente, un tipo de red neuronal generativa profunda de inteligencia artificial. Su código y pesos del modelo se publicaron de forma abierta, y una versión optimizada puede ejecutarse en la mayoría del hardware de consumo equipado con una GPU modesta de tan solo 2.4 GB de VRAM. Esta accesibilidad lo distinguió de modelos anteriores y contribuyó a su adopción generalizada.
Desarrollo
Stable Diffusion se originó a partir de un proyecto llamado difusión latente, desarrollado en Alemania por investigadores de la LMU de Múnich y la Universidad de Heidelberg. Cuatro de los cinco autores originales - Robin Rombach, Andreas Blattmann, Patrick Esser y Dominik Lorenz - se unieron posteriormente a Stability AI y lanzaron versiones subsiguientes del modelo. La licencia técnica fue publicada por el grupo CompVis de la LMU de Múnich, con el desarrollo liderado por Patrick Esser de Runway y Robin Rombach de CompVis, quienes habían inventado antes la arquitectura de difusión latente. Stability AI también acreditó a EleutherAI y LAION, una organización sin fines de lucro alemana que ensambló el conjunto de datos de entrenamiento, como partidarios.
Tecnología
Arquitectura
Los modelos de difusión, introducidos en 2015, se entrenan para eliminar aplicaciones sucesivas de ruido gaussiano en imágenes de entrenamiento, similar a una secuencia de autoencoders de denoising. El nombre deriva de la difusión termodinámica, ya que el desarrollo inicial se inspiró en la termodinámica. Los modelos de la serie Stable Diffusion anteriores a SD 3 utilizaban una variante llamada modelo de difusión latente (LDM), desarrollada en 2021 por el grupo CompVis de la LMU de Múnich.
Stable Diffusion consta de tres partes: un autoencoder variacional (VAE), una U-Net y un codificador de texto opcional. El codificador VAE comprime las imágenes del espacio de píxeles a un espacio latente más pequeño, capturando el significado semántico fundamental. El ruido gaussiano se aplica de manera iterativa a la representación latente comprimida durante la difusión directa. El bloque U-Net, compuesto por una red de base ResNet, elimina el ruido de la salida para obtener una representación latente, y el decodificador VAE genera la imagen final convirtiendo la representación de nuevo al espacio de píxeles.
El paso de denoising puede condicionarse a texto, una imagen u otra modalidad mediante un mecanismo de atención cruzada. Para el condicionamiento por texto, un codificador de texto CLIP ViT-L/14 fijo y preentrenado transforma los prompts en un espacio de incrustaciones. Los investigadores señalan una mayor eficiencia computacional para el entrenamiento y la generación como una ventaja de los LDM. Con 860 millones de parámetros en la U-Net y 123 millones en el codificador de texto, Stable Diffusion es relativamente ligero para los estándares de 2022 y puede ejecutarse en GPUs de consumo, o incluso solo con CPU mediante la versión OpenVINO.
#### SD XL
La versión XL utiliza la misma arquitectura LDM pero más grande: una red de base U-Net más grande, un contexto de atención cruzada más amplio, dos codificadores de texto en lugar de uno y entrenamiento en múltiples relaciones de aspecto. El SD XL Refiner, lanzado simultáneamente, tiene la misma arquitectura pero se entrenó para añadir detalles finos a imágenes preexistentes mediante img2img condicionado por texto.
#### SD 3.0
La versión 3.0 cambia la red de base por completo, utilizando un Transformer de Flujo Rectificado en lugar de una U-Net. La arquitectura tiene tres vías para la codificación de texto original, la codificación de texto transformado y la codificación de imagen en el espacio latente, con las dos últimas mezcladas en cada bloque del transformer. Se denomina "transformer de difusión multimodal" (MMDiT), lo que refleja que mezcla internamente las codificaciones de texto e imagen, a diferencia de las versiones DiT anteriores donde el texto afecta a la imagen pero no al revés.
Datos de Entrenamiento
Stable Diffusion se entrenó con pares de imagen y pie de foto de LAION-5B, un conjunto de datos disponible públicamente derivado de datos web de Common Crawl. LAION-5B contiene 5 mil millones de pares de imagen y texto clasificados por idioma y filtrados por resolución, probabilidad de marca de agua y puntuación estética predicha. El conjunto de datos fue creado por LAION, una organización sin fines de lucro alemana financiada por Stability AI. El modelo se entrenó en tres subconjuntos: laion2B-en, laion-high-resolution y laion-aesthetics v2 5+. Un análisis de terceros de un subconjunto más pequeño de 12 millones de imágenes encontró que aproximadamente el 47% provenía de 100 dominios, con Pinterest ocupando el 8.5%, seguido de WordPress, Blogspot, Flickr, DeviantArt y Wikimedia Commons. Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles.
Procedimientos de Entrenamiento
El modelo se entrenó inicialmente en laion2B-en y laion-high-resolution, con rondas finales en LAION-Aesthetics v2 5+, un subconjunto de 600 millones de imágenes con pies de foto que se predijo que recibirían una puntuación de al menos 5 sobre 10 de evaluadores humanos. Este subconjunto excluyó imágenes de baja resolución y aquellas con una probabilidad de marca de agua predicha superior al 80%. Las rondas finales de entrenamiento redujeron un 10% el condicionamiento por texto para mejorar la Guía de Difusión sin Clasificador. El modelo se entrenó utilizando 256 GPUs Nvidia A100 en Amazon Web Services durante 150,000 horas de GPU, a un costo de $600,000.
Limitaciones
Stable Diffusion tiene problemas conocidos de degradación, como dificultad para renderizar manos y texto, y puede producir contenido sesgado o dañino debido a los datos de entrenamiento. El lanzamiento público generó preocupaciones sobre el uso indebido, incluidos los deepfakes y la infracción de derechos de autor, lo que llevó a debates continuos sobre la regulación y el uso ético en la comunidad de aprendizaje automático.
Impacto
El lanzamiento de Stable Diffusion en 2022 aceleró significativamente el movimiento artístico de aprendizaje profundo, permitiendo a aficionados y artistas generar imágenes de alta calidad en hardware personal. Influyó en modelos posteriores de texto a imagen y contribuyó al auge más amplio de la IA, con aplicaciones en arte, diseño y creación de contenido. La naturaleza de código abierto del modelo fomentó un gran ecosistema de herramientas comunitarias y variantes ajustadas, aunque también provocó discusiones sobre la propiedad intelectual y el futuro del trabajo creativo.
Recepción y Legado
El modelo recibió una atención generalizada por sus logros técnicos y accesibilidad. Fue elogiado por su eficiencia y calidad, pero también criticado por su posible uso indebido. A partir de 2025, Stable Diffusion sigue siendo una referencia fundamental en la IA generativa, con desarrollo continuo por parte de Stability AI y la comunidad de código abierto. Su arquitectura y enfoque de entrenamiento se han adaptado en numerosos modelos posteriores, consolidando su legado en el campo.