Parti est un modèle de génération d'images texte-à-image autorégressif développé par Google DeepMind. Il génère des images à partir de descriptions textuelles en traitant la génération d'images comme un problème de séquence-à-séquence, similaire à la manière dont les grands modèles de langage génèrent du texte. Parti a été introduit en 2022 et est notable pour sa capacité à produire des images haute fidélité et photoréalistes à partir de prompts complexes, y compris des scènes avec plusieurs objets et des attributs spécifiques.
Le modèle fonctionne d'abord en convertissant un prompt textuel d'entrée en une séquence de jetons à l'aide d'un encodeur, puis en prédisant de manière autorégressive une séquence de jetons d'image. Ces jetons d'image sont dérivés d'un codebook visuel discret, appris séparément. Cette approche permet à Parti de se mettre à l'échelle efficacement avec la taille du modèle et les données d'entraînement, conduisant à des améliorations de la qualité d'image et de l'alignement sémantique.
Architecture
L'architecture de Parti est basée sur le modèle Transformer. Il utilise une structure encodeur-décodeur où l'encodeur traite le prompt textuel, et le décodeur génère la séquence de jetons d'image. Les jetons visuels sont obtenus à partir d'un modèle Vision Transformer (ViT) pré-entraîné, qui agit comme un tokeniseur. Le décodeur est entraîné à prédire le prochain jeton d'image étant donné le texte et les jetons précédemment générés, un processus analogue à la modélisation de séquences en apprentissage automatique.
Le modèle a été entraîné en différentes tailles, allant de 350 millions à 20 milliards de paramètres. La plus grande variante, Parti-20B, a démontré des performances de pointe sur des benchmarks comme MS-COCO et Localized Narratives, atteignant des scores FID (Fréchet Inception Distance) élevés, qui mesurent la similarité entre les distributions d'images générées et réelles.
Entraînement et Données
Parti a été entraîné sur un grand ensemble de données de paires image-texte, comprenant des données web publiques et des ensembles de données propriétaires. Le processus d'entraînement impliquait deux étapes : d'abord, l'apprentissage du codebook visuel à l'aide d'un tokeniseur basé sur ViT, puis l'entraînement du transformateur autorégressif pour prédire les jetons d'image à partir du texte. Le modèle a été optimisé en utilisant une perte d'entropie croisée standard sur les jetons d'image discrets.
Google a rapporté que la mise à l'échelle de la taille du modèle et des données d'entraînement a conduit à des améliorations cohérentes de la qualité d'image, en particulier pour les prompts complexes nécessitant un raisonnement compositionnel. Le modèle a également montré une capacité à gérer des prompts avec plusieurs objets, des relations spatiales et des attributs stylistiques.
Capacités et Limitations
Parti excelle dans la génération d'images avec une haute fidélité et une précision sémantique. Il peut produire des images à partir de prompts décrivant des scènes spécifiques, comme « une photo d'un chat portant un chapeau » ou « une peinture d'une ville futuriste au coucher du soleil ». Le modèle prend également en charge le rendu de texte, une tâche difficile pour de nombreux modèles de génération d'images. Cependant, Parti a des limitations, y compris des erreurs occasionnelles dans les détails fins, comme des comptes d'objets incorrects ou des attributs légèrement incohérents. Il nécessite également des ressources computationnelles substantielles pour l'entraînement et l'inférence.
Comparaison avec d'Autres Modèles
Parti a été développé en parallèle avec d'autres modèles texte-à-image comme DALL-E 2 et Imagen. Alors qu'Imagen utilise une approche basée sur la diffusion, Parti est autorégressif, ce qui lui permet de tirer parti des avancées en modélisation de séquences. Dans les évaluations, Parti-20B a obtenu des résultats compétitifs ou supérieurs sur des benchmarks comme MS-COCO par rapport à DALL-E 2 et Imagen, en particulier en termes de scores FID et d'évaluations humaines. Cependant, les modèles de diffusion comme Imagen ont été notés pour leur forte performance sur certaines qualités esthétiques, tandis que Parti excellait dans l'alignement sémantique et le raisonnement complexe.
Impact et Héritage
Parti a contribué à l'avancement rapide de l'IA générative dans la synthèse d'images. Son approche autorégressive a influencé la recherche ultérieure sur les modèles multimodaux unifiés, où le texte et les images sont traités dans un espace de jetons partagé. Le codebook et les idées de mise à l'échelle de Parti ont ensuite été incorporés dans d'autres modèles de Google, comme la famille Gemini, qui intègre la génération de texte, d'image et d'audio. Le modèle a également souligné l'importance des lois de mise à l'échelle dans les tâches vision-langage, s'alignant avec les découvertes en recherche sur le apprentissage profond.