Muse es un modelo generativo de texto a imagen desarrollado por Google, anunciado por primera vez en un artículo de investigación en enero de 2023. Pertenece a la familia de modelos basados en transformers y está diseñado para generar imágenes de alta resolución a partir de descripciones textuales. A diferencia de los modelos basados en difusión, como Stable Diffusion o DALL-E, Muse opera sobre tokens discretos en un espacio de imagen comprimido, utilizando un enfoque generativo enmascarado inspirado en el modelado de lenguaje enmascarado en los modelos de lenguaje grandes.
El modelo fue desarrollado por investigadores de Google y Google DeepMind, basándose en trabajos previos sobre cuantización vectorial y arquitecturas de transformadores. Se detalló públicamente en el artículo "Muse: Text-To-Image Generation via Masked Generative Transformers", que demostró resultados de última generación en puntos de referencia como MS-COCO y capacidades de generación de cero disparos. Google posicionó a Muse como una alternativa más eficiente a los modelos de difusión, afirmando tiempos de inferencia más rápidos mientras mantenía una calidad de imagen competitiva.
Arquitectura
Muse utiliza un proceso de dos etapas. Primero, un autoencoder variacional (VAE) preentrenado comprime las imágenes en una cuadrícula de tokens discretos, similar al enfoque utilizado en VQGAN o VQ-VAE. Segundo, se entrena un modelo de transformador para predecir tokens enmascarados en esta cuadrícula, condicionado por incrustaciones de texto producidas por un modelo de lenguaje grande congelado (específicamente T5). Durante la generación, el modelo comienza con todos los tokens enmascarados y predice iterativamente los tokens más confiables, completando el resto en varios pasos. Esta técnica de modelado enmascarado permite la decodificación paralela, lo que acelera la generación en comparación con los modelos autorregresivos.
El codificador de texto es un modelo T5-XXL congelado, que proporciona representaciones semánticas ricas. El tokenizador de imágenes es un VAE entrenado en un gran conjunto de datos de imágenes, que produce una cuadrícula de tokens de 256x256 o 512x512 según la configuración. El transformador en sí es una arquitectura estándar de codificador-decodificador, con las incrustaciones de texto como entrada del codificador y los tokens de imagen enmascarados como entrada del decodificador.
Entrenamiento y datos
Muse se entrenó en un gran corpus de pares de imagen y texto, incluido el conjunto de datos público LAION-5B y conjuntos de datos internos de Google. El proceso de entrenamiento implicó dos etapas: primero, el VAE se entrenó por separado solo con imágenes; luego, el transformador se entrenó para predecir tokens enmascarados dado el texto y el contexto no enmascarado. El modelo se entrenó en pods de TPU v4, con la variante más grande con 3 mil millones de parámetros. El artículo informó que Muse logró una puntuación FID de cero disparos de 7.9 en MS-COCO, superando a modelos de difusión anteriores como GLIDE y DALL-E 2 en ese momento.
Capacidades
El modelo admite varias tareas más allá de la generación de texto a imagen. Puede realizar edición de imágenes enmascarando parcialmente una imagen de entrada y proporcionando un mensaje de texto, lo que permite cambios localizados. También admite outpainting (extender una imagen más allá de sus bordes) e inpainting (rellenar regiones faltantes). Además, Muse puede generar imágenes con una relación de aspecto variable y puede ajustarse finamente para estilos o dominios específicos. El artículo demostró que Muse podía producir imágenes de alta calidad de 512x512 en aproximadamente 1.5 segundos en una sola TPU, lo que es significativamente más rápido que los modelos de difusión que requieren muchos pasos de eliminación de ruido.
Comparación con otros modelos
Muse se compara a menudo con DALL-E 2 y Imagen, ambos utilizan procesos de difusión. Los modelos de difusión agregan y eliminan ruido gradualmente, requiriendo cientos de pasos. Muse, en contraste, utiliza un enfoque de tokens discretos con desenmascarado iterativo, que típicamente requiere solo 10-20 pasos. Esto lo hace más eficiente computacionalmente durante la inferencia. Sin embargo, los modelos de difusión han sido más ampliamente adoptados en sistemas de producción, en parte debido a su simplicidad y robustez. La dependencia de Muse en un espacio de tokens discretos puede a veces conducir a artefactos, especialmente con texturas complejas o detalles finos.
Recepción e impacto
Muse fue bien recibido en la comunidad de investigación por su uso innovador del modelado enmascarado en el dominio de la imagen. Influyó en trabajos posteriores sobre difusión discreta y generación basada en tokens. Sin embargo, Google no lanzó Muse como un producto público o API, a diferencia de sus modelos posteriores como Imagen o Gemini. El código y los pesos no fueron de código abierto, lo que limitó la reproducibilidad. No obstante, las ideas de Muse se han incorporado en modelos posteriores de Google y han inspirado esfuerzos de código abierto como Parti y MuseGAN.
Véase también
Referencias
- Chang, H., et al. (2023). "Muse: Text-To-Image Generation via Masked Generative Transformers." arXiv:2301.00704.
- Google AI Blog. (2023). "Muse: A New Text-to-Image Model."