Traduit de l'anglais

Muse est un modèle d'IA génératif texte-image développé par Google, introduit en 2023, qui utilise un transformateur génératif masqué pour créer et éditer des images à partir de prompts textuels avec une haute fidélité et rapidité.

Muse est un modèle génératif texte-image développé par Google, annoncé pour la première fois dans un article de recherche en janvier 2023. Il appartient à la famille des modèles basés sur transformeur et est conçu pour générer des images haute résolution à partir de descriptions textuelles. Contrairement aux modèles basés sur la diffusion tels que Stable Diffusion ou DALL-E, Muse opère sur des jetons discrets dans un espace d'image compressé, en utilisant une approche générative masquée inspirée du modelage linguistique masqué dans les grands modèles de langage.

Le modèle a été développé par des chercheurs de Google et de Google DeepMind, en s'appuyant sur des travaux antérieurs en quantification vectorielle et en architectures de transformeurs. Il a été détaillé publiquement dans l'article « Muse: Text-To-Image Generation via Masked Generative Transformers », qui a démontré des résultats de pointe sur des références comme MS-COCO et des capacités de génération en zéro-shot. Google a positionné Muse comme une alternative plus efficace aux modèles de diffusion, affirmant des temps d'inférence plus rapides tout en maintenant une qualité d'image compétitive.

Architecture

Muse utilise un pipeline en deux étapes. D'abord, un autoencodeur variationnel (VAE) pré-entraîné compresse les images en une grille de jetons discrets, similaire à l'approche utilisée dans VQGAN ou VQ-VAE. Ensuite, un modèle de transformeur est entraîné à prédire les jetons masqués dans cette grille, conditionné par des plongements textuels produits par un grand modèle de langage figé (spécifiquement T5). Pendant la génération, le modèle commence avec tous les jetons masqués et prédit itérativement les jetons les plus confiants, remplissant le reste en plusieurs étapes. Cette technique de modelage masqué permet un décodage parallèle, ce qui accélère la génération par rapport aux modèles autorégressifs.

L'encodeur de texte est un modèle T5-XXL figé, qui fournit des représentations sémantiques riches. Le tokeniseur d'image est un VAE entraîné sur un grand ensemble de données d'images, produisant une grille de jetons de 256x256 ou 512x512 selon la configuration. Le transformeur lui-même est une architecture encodeur-décodeur standard, avec les plongements textuels comme entrée de l'encodeur et les jetons d'image masqués comme entrée du décodeur.

Entraînement et données

Muse a été entraîné sur un grand corpus de paires image-texte, y compris l'ensemble de données publiquement disponible LAION-5B et des ensembles de données internes de Google. Le processus d'entraînement a impliqué deux étapes : d'abord, le VAE a été entraîné séparément sur des images seules ; ensuite, le transformeur a été entraîné à prédire les jetons masqués à partir du texte et du contexte non masqué. Le modèle a été entraîné sur des pods TPU v4, avec la plus grande variante ayant 3 milliards de paramètres. L'article a rapporté que Muse a atteint un score FID en zéro-shot de 7,9 sur MS-COCO, surpassant les modèles de diffusion antérieurs comme GLIDE et DALL-E 2 à l'époque.

Capacités

Le modèle prend en charge plusieurs tâches au-delà de la génération texte-image. Il peut effectuer une édition d'image en masquant partiellement une image d'entrée et en fournissant une invite textuelle, permettant des modifications localisées. Il prend également en charge l'outpainting (extension d'une image au-delà de ses bordures) et l'inpainting (remplissage de régions manquantes). De plus, Muse peut générer des images avec un rapport hauteur-largeur variable et peut être affiné pour des styles ou domaines spécifiques. L'article a démontré que Muse pouvait produire des images 512x512 de haute qualité en environ 1,5 seconde sur un seul TPU, ce qui est significativement plus rapide que les modèles de diffusion qui nécessitent de nombreuses étapes de débruitage.

Comparaison avec d'autres modèles

Muse est souvent comparé à DALL-E 2 et Imagen, qui utilisent tous deux des processus de diffusion. Les modèles de diffusion ajoutent et retirent progressivement du bruit, nécessitant des centaines d'étapes. Muse, en revanche, utilise une approche de jetons discrets avec démascarage itératif, nécessitant généralement seulement 10 à 20 étapes. Cela le rend plus efficace en calcul pendant l'inférence. Cependant, les modèles de diffusion ont été plus largement adoptés dans les systèmes de production, en partie en raison de leur simplicité et de leur robustesse. La dépendance de Muse à un espace de jetons discrets peut parfois conduire à des artefacts, surtout avec des textures complexes ou des détails fins.

Réception et impact

Muse a été bien accueilli dans la communauté de recherche pour son utilisation innovante du modelage masqué dans le domaine de l'image. Il a influencé des travaux ultérieurs sur la diffusion discrète et la génération basée sur les jetons. Cependant, Google n'a pas publié Muse comme produit public ou API, contrairement à ses modèles ultérieurs tels que Imagen ou Gemini. Le code et les poids n'ont pas été open-sourcés, limitant la reproductibilité. Néanmoins, les idées de Muse ont été incorporées dans les modèles ultérieurs de Google et ont inspiré des efforts open-source comme Parti et MuseGAN.

Voir aussi

Références

  • Chang, H., et al. (2023). « Muse: Text-To-Image Generation via Masked Generative Transformers. » arXiv:2301.00704.
  • Blog Google AI. (2023). « Muse: A New Text-to-Image Model. »
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·generative-ai·google-deepmind·transformer
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique