Stable Diffusion

Traducido del inglés

Stable Diffusion es un modelo de texto a imagen de código abierto lanzado en agosto de 2022 por Stability AI, basado en tecnología de difusión latente. Genera imágenes detalladas a partir de indicaciones de texto y se ejecuta en hardware de consumo, marcando un cambio respecto a los modelos propietarios exclusivos en la nube.

Stable Diffusion es un modelo de aprendizaje profundo de texto a imagen, lanzado en agosto de 2022, basado en técnicas de difusión. Es el producto principal de Stability AI y se considera parte del actual auge de la IA. El modelo genera imágenes detalladas condicionadas por descripciones de texto, y también admite tareas como inpainting, outpainting y traducción de imagen a imagen guiada por indicaciones de texto. Su desarrollo involucró a investigadores del Grupo CompVis de la LMU Múnich y Runway, con una donación computacional de Stability AI y datos de entrenamiento de organizaciones sin fines de lucro.

Stable Diffusion es un modelo de difusión latente, un tipo de red neuronal artificial generativa profunda. Su código y pesos del modelo se publicaron públicamente, y una versión optimizada se ejecuta en la mayoría del hardware de consumo con una GPU modesta usando tan solo 2.4 GB de VRAM. Esta diferencia respecto a los modelos de texto a imagen propietarios como DALL-E y Midjourney, que solo eran accesibles mediante servicios en la nube, hizo que Stable Diffusion estuviera ampliamente disponible para usuarios individuales e investigadores.

Desarrollo

Stable Diffusion se originó a partir de un proyecto llamado difusión latente, desarrollado en Alemania por investigadores de la LMU Múnich y la Universidad de Heidelberg. Cuatro de los cinco autores originales - Robin Rombach, Andreas Blattmann, Patrick Esser y Dominik Lorenz - se unieron posteriormente a Stability AI y lanzaron versiones subsiguientes. La licencia técnica fue publicada por el grupo CompVis de la LMU Múnich. El desarrollo fue liderado por Patrick Esser de Runway y Robin Rombach de CompVis, quienes habían inventado anteriormente la arquitectura de difusión latente. Stability AI también acreditó a EleutherAI y LAION, una organización sin fines de lucro alemana que ensambló el conjunto de datos de entrenamiento, como partidarios del proyecto.

Tecnología

Arquitectura

Los modelos de difusión, introducidos en 2015, se entrenan para eliminar aplicaciones sucesivas de ruido gaussiano en imágenes de entrenamiento, funcionando como una secuencia de autoencoders de denoising. El nombre proviene de la difusión termodinámica, ya que la técnica fue inspirada por la termodinámica. Los modelos de la serie Stable Diffusion anteriores a SD 3 usaban una variante llamada modelo de difusión latente (LDM), desarrollado en 2021 por el grupo CompVis de la LMU Múnich.

Stable Diffusion consta de tres partes: un autoencoder variacional (VAE), una U-Net y un codificador de texto opcional. El codificador VAE comprime imágenes del espacio de píxeles a un espacio latente de menor dimensión, capturando el significado semántico. Se aplica ruido gaussiano iterativamente a la representación latente comprimida durante la difusión directa. El bloque U-Net, compuesto por un backbone ResNet, denoisa la salida hacia atrás para obtener una representación latente. Finalmente, el decodificador VAE genera la imagen final convirtiendo la representación de vuelta al espacio de píxeles.

El paso de denoising puede estar condicionado por texto, una imagen u otra modalidad. Los datos de condicionamiento codificados se exponen a las U-Nets de denoising mediante un mecanismo de atención cruzada. Para el condicionamiento por texto, un codificador de texto CLIP ViT-L/14 fijo y preentrenado transforma las indicaciones en un espacio de incrustaciones. Los investigadores citan una mayor eficiencia computacional para el entrenamiento y la generación como una ventaja de los LDM.

Con 860 millones de parámetros en la U-Net y 123 millones en el codificador de texto, Stable Diffusion es relativamente ligero para los estándares de 2022. A diferencia de otros modelos de difusión, se ejecuta en GPUs de consumo, e incluso solo con CPU usando la versión OpenVINO.

#### SD XL

La versión XL usa la misma arquitectura LDM pero más grande: un backbone UNet más grande, un contexto de atención cruzada más amplio, dos codificadores de texto en lugar de uno, y entrenamiento en múltiples relaciones de aspecto en lugar de solo cuadrado. El SD XL Refiner, lanzado simultáneamente, tiene la misma arquitectura pero fue entrenado para añadir detalles finos a imágenes preexistentes mediante img2img condicionado por texto.

#### SD 3.0

La versión 3.0 cambia completamente el backbone. Usa un Transformer de Flujo Rectificado, implementando el método de flujo rectificado con una arquitectura transformador. La arquitectura tiene tres pistas: codificación de texto original, codificación de texto transformada y codificación de imagen en espacio latente. La codificación de texto transformada y la codificación de imagen se mezclan durante cada bloque del transformer. Esto se denomina "transformador de difusión multimodal (MMDiT)", donde multimodal significa que mezcla codificaciones de texto e imagen dentro de sus operaciones, a diferencia de versiones anteriores de DiT donde la codificación de texto afectaba la codificación de imagen pero no viceversa.

Datos de Entrenamiento

Stable Diffusion fue entrenado en pares de imagen y subtítulo de LAION-5B, un conjunto de datos disponible públicamente derivado de raspados web de Common Crawl. Los 5 mil millones de pares de imagen y texto se clasificaron por idioma y se filtraron en conjuntos de datos por resolución, probabilidad de marca de agua predicha y puntuación "estética" predicha. LAION, una organización sin fines de lucro alemana que recibe financiación de Stability AI, creó el conjunto de datos. El modelo fue entrenado en tres subconjuntos: laion2B-en, laion-high-resolution y laion-aesthetics v2 5+.

Un análisis de terceros de un subconjunto más pequeño de 12 millones de imágenes encontró que aproximadamente el 47% provenía de 100 dominios, con Pinterest tomando el 8.5%, seguido de WordPress, Blogspot, Flickr, DeviantArt y Wikimedia Commons. Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles.

Procedimientos de Entrenamiento

El modelo fue inicialmente entrenado en laion2B-en y laion-high-resolution, con rondas finales en LAION-Aesthetics v2 5+, un subconjunto de 600 millones de imágenes subtituladas predichas para recibir al menos 5 de 10 en calificaciones estéticas humanas. Este subconjunto excluyó imágenes de baja resolución y aquellas con una probabilidad de detección de marca de agua superior al 80%. Las rondas finales de entrenamiento redujeron un 10% el condicionamiento de texto para mejorar la Guía de Difusión Sin Clasificador. El entrenamiento usó 256 GPUs Nvidia A100 en Amazon Web Services durante 150,000 horas de GPU, con un costo de $600,000.

Limitaciones

Stable Diffusion tiene problemas con degradación y artefactos, particularmente en escenas complejas, anatomía humana y renderizado de texto. Puede reproducir sesgos de los datos de entrenamiento, incluidos estereotipos y contenido dañino. El modelo tiene dificultades con detalles finos como manos y caras, produciendo a menudo resultados distorsionados. También tiene dificultades con indicaciones compositivas que involucran múltiples objetos o relaciones espaciales específicas. A partir de 2024, las versiones más nuevas abordan algunas limitaciones pero aún enfrentan desafíos en estas áreas.

Impacto y Recepción

La publicación pública de Stable Diffusion en agosto de 2022 provocó una discusión generalizada sobre ética de la IA generativa, derechos de autor y trabajo artístico. Su naturaleza de código abierto permitió a los desarrolladores crear herramientas para la experimentación en aprendizaje automático, aumento de datos y flujos de trabajo creativos. La accesibilidad del modelo en hardware de consumo contribuyó a un aumento en las comunidades de arte con IA y aplicaciones comerciales. Stability AI lanzó versiones posteriores, incluyendo SD XL en 2023 y SD 3.0 en 2024, cada una mejorando la calidad y las capacidades. El modelo también influyó en debates políticos, llevando a discusiones sobre regulación de la IA y procedencia del contenido.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·text-to-image·open-source-software·diffusion-models
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial