Lanzamiento de Stable Diffusion

Traducido del inglés

Stable Diffusion es un modelo de aprendizaje profundo de código abierto para generar imágenes a partir de texto, lanzado en 2022 por Stability AI, que popularizó el arte generativo al ejecutarse en hardware de consumo. Utiliza difusión latente para generar imágenes detalladas a partir de indicaciones de texto.

Stable Diffusion es un modelo de aprendizaje profundo de texto a imagen lanzado en 2022 basado en técnicas de difusión. La tecnología de IA generativa es el producto principal de Stability AI y se considera parte del auge actual de la IA. Se utiliza principalmente para generar imágenes detalladas condicionadas por descripciones de texto, aunque también puede aplicarse a otras tareas como la inpintura, la outpintura y la generación de traducciones de imagen a imagen guiadas por un prompt de texto. Su desarrollo involucró a investigadores del Grupo CompVis de la LMU de Múnich y Runway, con una donación computacional de Stability y datos de entrenamiento de organizaciones sin fines de lucro.

Stable Diffusion es un modelo de difusión latente, un tipo de red neuronal artificial generativa profunda. Su código y pesos del modelo se han publicado públicamente, y una versión optimizada puede ejecutarse en la mayoría del hardware de consumo equipado con una GPU modesta con tan solo 2.4 GB de VRAM. Esto marcó una diferencia con respecto a los modelos propietarios anteriores de texto a imagen como DALL-E y Midjourney, que solo eran accesibles a través de servicios en la nube.

Desarrollo

Stable Diffusion se originó a partir de un proyecto llamado difusión latente, desarrollado en Alemania por investigadores de la LMU de Múnich y la Universidad de Heidelberg. Cuatro de los cinco autores originales (Robin Rombach, Andreas Blattmann, Patrick Esser y Dominik Lorenz) se unieron posteriormente a Stability AI y lanzaron versiones posteriores de Stable Diffusion. La licencia técnica del modelo fue publicada por el grupo CompVis de la LMU de Múnich. El desarrollo fue liderado por Patrick Esser de Runway y Robin Rombach de CompVis, quienes estuvieron entre los investigadores que habían inventado anteriormente la arquitectura de modelo de difusión latente utilizada por Stable Diffusion. Stability AI también acreditó a EleutherAI y LAION, una organización alemana sin fines de lucro que ensambló el conjunto de datos con el que se entrenó Stable Diffusion, como partidarios del proyecto.

El lanzamiento de Stable Diffusion en 2022 marcó un cambio significativo en la accesibilidad de las herramientas de IA generativa. A diferencia de los modelos anteriores que requerían acceso a la nube, Stable Diffusion podía ejecutarse localmente, lo que permitió a una comunidad más amplia de artistas y desarrolladores experimentar con la generación de texto a imagen. Esto contribuyó a su rápida adopción y a la proliferación del arte generado por IA en diversas plataformas en línea.

Tecnología

Arquitectura

Los modelos de difusión, introducidos en 2015, se entrenan con el objetivo de eliminar las aplicaciones sucesivas de ruido gaussiano en las imágenes de entrenamiento, lo que puede considerarse como una secuencia de autoencoders de denoising. El nombre de difusión proviene de la difusión termodinámica, ya que se desarrollaron por primera vez con inspiración de la termodinámica. Los modelos de la serie Stable Diffusion anteriores a SD 3 utilizaban una variante de los modelos de difusión, llamada modelo de difusión latente (LDM), desarrollado en 2021 por el grupo CompVis (Computer Vision & Learning) de la LMU de Múnich.

Stable Diffusion consta de 3 partes: el autoencoder variacional (VAE), U-Net y un codificador de texto opcional. El codificador VAE comprime la imagen del espacio de píxeles a un espacio latente de menor dimensión, capturando un significado semántico más fundamental de la imagen. Se aplica ruido gaussiano de manera iterativa a la representación latente comprimida durante la difusión directa. El bloque U-Net, compuesto por un backbone ResNet, denoisa la salida de la difusión directa hacia atrás para obtener una representación latente. Finalmente, el decodificador VAE genera la imagen final convirtiendo la representación de nuevo al espacio de píxeles.

El paso de denoising puede condicionarse de manera flexible a una cadena de texto, una imagen u otra modalidad. Los datos de condicionamiento codificados se exponen a las U-Nets de denoising mediante un mecanismo de atención cruzada. Para el condicionamiento con texto, se utiliza el codificador de texto fijo y preentrenado CLIP ViT-L/14 para transformar los prompts de texto a un espacio de incrustación. Los investigadores señalan una mayor eficiencia computacional para el entrenamiento y la generación como una ventaja de los LDM. Con 860 millones de parámetros en la U-Net y 123 millones en el codificador de texto, Stable Diffusion se considera relativamente ligero para los estándares de 2022 y, a diferencia de otros modelos de difusión, puede ejecutarse en GPUs de consumo, e incluso solo con CPU si se utiliza la versión OpenVINO de Stable Diffusion.

#### SD XL

La versión XL utiliza la misma arquitectura LDM que las versiones anteriores, excepto que es más grande: un backbone U-Net más grande, un contexto de atención cruzada más grande, dos codificadores de texto en lugar de uno, y entrenada en múltiples relaciones de aspecto (no solo la relación de aspecto cuadrada como las versiones anteriores). El SD XL Refiner, lanzado al mismo tiempo, tiene la misma arquitectura que SD XL, pero se entrenó para añadir detalles finos a imágenes preexistentes mediante img2img condicionado por texto.

#### SD 3.0

La versión 3.0 cambia completamente el backbone. No es una U-Net, sino un Transformer de Flujo Rectificado, que implementa el método de flujo rectificado con un transformador. La arquitectura Transformer utilizada para SD 3.0 tiene tres "pistas", para la codificación de texto original, la codificación de texto transformada y la codificación de imagen (en el espacio latente). La codificación de texto transformada y la codificación de imagen se mezclan durante cada bloque del transformer. La arquitectura se denomina "transformer de difusión multimodal (MMDiT)", donde "multimodal" significa que mezcla codificaciones de texto e imagen dentro de sus operaciones. Esto difiere de las versiones anteriores de DiT, donde la codificación de texto afecta la codificación de imagen, pero no al revés.

Datos de entrenamiento

Stable Diffusion se entrenó con pares de imágenes y subtítulos tomados de LAION-5B, un conjunto de datos disponible públicamente derivado de datos de Common Crawl extraídos de la web, donde 5 mil millones de pares de imagen-texto se clasificaron según el idioma y se filtraron en conjuntos de datos separados por resolución, una probabilidad predicha de contener una marca de agua y una puntuación "estética" predicha (por ejemplo, calidad visual subjetiva). El conjunto de datos fue creado por LAION, una organización alemana sin fines de lucro que recibe financiación de Stability AI. El modelo Stable Diffusion se entrenó en tres subconjuntos de LAION-5B: laion2B-en, laion-high-resolution y laion-aesthetics v2 5+. Un análisis de terceros de los datos de entrenamiento del modelo identificó que, de un subconjunto más pequeño de 12 millones de imágenes tomadas del conjunto de datos más amplio original utilizado, aproximadamente el 47% de la muestra de imágenes provenía de 100 dominios diferentes, con Pinterest ocupando el 8.5% del subconjunto, seguido de sitios web como WordPress, Blogspot, Flickr, DeviantArt y Wikimedia Commons. Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles.

Procedimientos de entrenamiento

El modelo se entrenó inicialmente en los subconjuntos laion2B-en y laion-high-resolution, con las últimas rondas de entrenamiento realizadas en LAION-Aesthetics v2 5+, un subconjunto de 600 millones de imágenes subtituladas que el Predictor LAION-Aesthetics V2 predijo que los humanos, en promedio, darían una puntuación de al menos 5 de 10 cuando se les pidiera calificar cuánto les gustaban. El subconjunto LAION-Aesthetics v2 5+ también excluyó imágenes de baja resolución e imágenes que LAION-5B-WatermarkDetection identificó como portadoras de una marca de agua con una probabilidad mayor al 80%. Las rondas finales de entrenamiento también eliminaron el 10% del condicionamiento de texto para mejorar la Guía de Difusión sin Clasificador. El modelo se entrenó utilizando 256 GPUs Nvidia A100 en Amazon Web Services durante un total de 150,000 horas de GPU, a un costo de $600,000.

Impacto y legado

La publicación pública del código y los pesos de Stable Diffusion tuvo un impacto profundo en el campo de la inteligencia artificial y el arte digital. Democratizó el acceso a la potente generación de texto a imagen, permitiendo a individuos y pequeños equipos crear imágenes de alta calidad sin necesidad de una infraestructura de nube costosa. Esto condujo a un aumento en las aplicaciones creativas, desde arte conceptual e ilustración hasta publicidad y diseño de juegos. El modelo también impulsó más investigación en aprendizaje automático, particularmente en áreas como la compresión de modelos y la inferencia eficiente, ya que los desarrolladores buscaban ejecutar el modelo en hardware cada vez más modesto.

Stable Diffusion también planteó importantes cuestiones éticas y legales sobre los derechos de autor, la privacidad de los datos y el potencial de uso indebido. El uso de datos web extraídos para el entrenamiento, incluidas imágenes con derechos de autor e información personal, se convirtió en un tema de debate y litigio. Estas preocupaciones impulsaron discusiones sobre la necesidad de prácticas de datos más transparentes y responsables en el desarrollo de modelos generativos, influyendo en el trabajo posterior en el campo.

Limitaciones

Stable Diffusion tiene problemas con la degradación y los artefactos, particularmente al generar escenas complejas o texto. Puede tener dificultades con la corrección anatómica, produciendo imágenes con manos o caras distorsionadas, y puede no renderizar con precisión el texto dentro de las imágenes. El rendimiento del modelo también depende de la calidad y diversidad de sus datos de entrenamiento, lo que puede llevar a sesgos en las imágenes generadas. Además, el costo computacional de entrenar y ajustar modelos grandes como SD 3.0 sigue siendo significativo, limitando la experimentación para algunos investigadores y desarrolladores.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·text-to-image·deep-learning·open-source
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial