Parti-20B est un modèle à 20 milliards de paramètres pour la génération d'images à partir de texte, développé par Google Research. Il appartient à la famille Parti, qui traite la génération d'images comme un problème de séquence à séquence, où un encodeur Transformer (architecture) traite le texte et un décodeur prédit des jetons visuels. Parti-20B est la variante la plus grande de la série, conçue pour produire des images très détaillées et sémantiquement alignées à partir de prompts complexes.
Le modèle repose sur le concept d'apprentissage Sequence-to-Sequence (Seq2Seq), en exploitant une architecture de réseau neuronal qui mappe l'entrée textuelle à une grille de jetons d'image. Contrairement aux approches basées sur la diffusion, Parti-20B utilise un décodeur autorégressif, générant des patchs d'image séquentiellement. Cette conception lui permet de s'adapter efficacement à la taille du modèle, améliorant la fidélité et la compréhension compositionnelle.
Architecture et Entraînement
Parti-20B utilise un transformer Encoder-Decoder Architecture, où l'encodeur traite le prompt textuel à l'aide de Multi-Head Attention et de Positional Encoding. Le décodeur prédit ensuite une séquence de jetons visuels discrets, qui sont mappés aux pixels via un codebook appris. L'entraînement implique un grand ensemble de données de paires image-texte, avec une optimisation utilisant Adam (Optimizer) et un Learning Rate Scheduling. Le modèle utilise Layer Normalization et Dropout pour la stabilité, ainsi que Gradient Clipping pour gérer l'entraînement à grande échelle.
Le processus de génération autorégressive repose sur Beam Search ou des stratégies d'échantillonnage comme Top-K Sampling et Top-P (Nucleus) Sampling, avec Temperature Scaling pour contrôler la diversité. L'échelle de Parti-20B lui permet de capturer des détails fins, tels que les textures et les relations spatiales, que les modèles plus petits manquent.
Capacités et Performances
Parti-20B excelle à suivre des prompts complexes, y compris ceux avec plusieurs objets, attributs et contraintes spatiales. Il peut générer des images photoréalistes, des styles artistiques et des compositions novatrices. Comparé aux modèles antérieurs, il montre des améliorations significatives en généralisation zero-shot, ce qui signifie qu'il peut gérer des prompts non vus sans réglage fin. Le modèle prend également en charge Data Augmentation pendant l'entraînement pour renforcer la robustesse.
Dans les évaluations de référence, Parti-20B a atteint des résultats de pointe sur les tâches de génération texte-image, surpassant de nombreux modèles contemporains en termes de FID (Fréchet Inception Distance) et de scores de préférence humaine. Ses 20 milliards de paramètres lui permettent de représenter une gamme plus large de concepts visuels, bien qu'il nécessite des ressources computationnelles substantielles pour l'inférence.
Relation avec d'Autres Modèles
Parti-20B fait partie d'une tendance plus large dans Generative AI, aux côtés de modèles comme DALL-E et Stable Diffusion. Il diffère des modèles de diffusion en utilisant une approche autorégressive, que certains chercheurs considèrent comme offrant un meilleur contrôle. Le modèle est lié aux techniques de Large language model, car il partage le backbone transformer et les objectifs d'entraînement adaptés aux images. Il se connecte également à la recherche sur les lois d'échelle en Machine learning, où des modèles plus grands améliorent constamment les performances.
Google n'a pas rendu Parti-20B public, limitant l'accès à la recherche interne et à des partenaires sélectionnés. Cela contraste avec les efforts open-source, mais s'aligne sur la stratégie de l'entreprise de développer des systèmes d'IA propriétaires. L'architecture du modèle a influencé les travaux ultérieurs en génération texte-image, y compris les améliorations en tokenisation et en efficacité de décodage.
Limites et Considérations Éthiques
Comme de nombreux modèles texte-image, Parti-20B peut produire des sorties biaisées ou nuisibles s'il est entraîné sur des données internet non filtrées. Il peut également avoir du mal avec des concepts rares ou des prompts ambigus, générant parfois des résultats absurdes. Le coût computationnel de l'exécution d'un modèle à 20 milliards de paramètres est élevé, nécessitant du matériel spécialisé comme les TPUs ou GPU de Google Cloud, ce qui limite l'accessibilité.
Les chercheurs ont souligné la nécessité de mesures de sécurité, telles que le filtrage des prompts et la modération des sorties. Le développement de Parti-20B soulève également des questions sur le droit d'auteur et le potentiel de mauvaise utilisation pour créer des images trompeuses. En 2023, ces préoccupations restent actives dans la communauté IA, suscitant des appels à un déploiement responsable.
Héritage et Impact
Parti-20B a démontré que l'adaptation de modèles autorégressifs à des dizaines de milliards de paramètres est viable pour la génération d'images, ouvrant la voie à des modèles ultérieurs comme Imagen et Gemini. Son succès a renforcé l'importance de l'échelle des modèles dans Deep learning et a inspiré des recherches supplémentaires sur des transformers efficaces. Bien qu'il ne soit pas disponible publiquement, ses contributions techniques ont été documentées dans des articles de recherche, influençant les efforts académiques et industriels.
L'approche du modèle consistant à traiter les images comme des séquences a également été appliquée à d'autres domaines, tels que la génération vidéo et la synthèse de scènes 3D. Parti-20B reste un point de référence pour comprendre les compromis entre les modèles génératifs autorégressifs et basés sur la diffusion, et ses conclusions continuent d'informer la conception des systèmes de nouvelle génération.