Imagen est une série de modèles de génération d'images à partir de texte développée par Google DeepMind, conçue pour produire des images de haute fidélité à partir de invites en langage naturel. Les modèles combinent une compréhension linguistique basée sur les transformeurs et une génération d'images par modèle de diffusion, ce qui les positionne parmi les outils d'IA générative notables comme DALL-E et Stable Diffusion. Imagen est accessible via divers services Google, notamment Gemini et Vertex AI, et a connu plusieurs versions majeures depuis son introduction.
Le modèle Imagen original a été présenté pour la première fois dans un article de recherche publié en mai 2022, développé par l'équipe Google Brain avant sa fusion avec DeepMind en avril 2023. Les versions suivantes, Imagen 2 et Imagen 3, ont été publiées respectivement en décembre 2023 et août 2024, chaque itération améliorant la qualité de l'image, le rendu du texte et le contrôle de l'utilisateur. En mai 2025, Google a annoncé Imagen 4 lors de sa conférence annuelle Google I/O, faisant progresser davantage les capacités du modèle.
Technologie
L'architecture d'Imagen repose sur deux technologies clés : un grand modèle de langage (LLM) figé pour l'encodage du texte et un modèle de diffusion en cascade pour la génération d'images. L'encodeur de texte, basé sur la famille de transformeurs T5, convertit les invites d'entrée en enchâssements sémantiques qui guident le processus de synthèse d'images. Le modèle de diffusion fonctionne ensuite en une série d'étapes, commençant par une image basse résolution (64 × 64 pixels) et la suréchantillonnant progressivement vers des résolutions plus élevées, atteignant finalement 1024 × 1024 pixels dans les versions antérieures. Imagen 4 étend cette capacité pour générer des images jusqu'à une résolution 2K, améliorant ainsi les détails et la fidélité visuelle.
La conception en cascade permet au modèle d'affiner les images de manière incrémentale, améliorant la cohérence et l'alignement avec la proposition de texte. Cette approche contraste avec les modèles à une seule étape, permettant un apprentissage plus efficace et des sorties de meilleure qualité. L'utilisation d'un LLM figé exploite également les avancées du traitement du langage naturel, permettant à Imagen de comprendre des invites complexes, y compris des concepts abstraits et des instructions stylistiques.
Capacités
Imagen excelle dans la génération d'images photoréalistes à partir de descriptions textuelles, mais il prend également en charge une large gamme de styles artistiques, notamment cinématographique, film 35 mm, illustration et esthétique surréaliste. Cette polyvalence le rend adapté aux applications créatives, telles que l'art numérique, la publicité et le design conceptuel. Le modèle peut générer des images dans plusieurs formats d'image, notamment 9:16, 3:4, 1:1, 4:3 et 16:9, s'adaptant ainsi à divers formats d'affichage et cas d'utilisation.
Au-delà de la génération initiale, Imagen offre des capacités d'édition, permettant aux utilisateurs d'affiner des images existantes en fournissant de nouvelles invites textuelles. Cette fonctionnalité permet des flux de travail créatifs et itératifs, où les utilisateurs peuvent ajuster la composition, le style ou des éléments spécifiques sans régénérer intégralement l'image. Cependant, comme d'autres modèles de génération de texte à image, Imagen présente des limites, notamment des difficultés à rendre précisément les doigts humains, le texte, les ambigrammes et d'autres typographies complexes. Ces défis sont courants dans le domaine et constituent des axes de recherche en cours.
Voir aussi
- Art assisté par intelligence artificielle
- Art assisté par ordinateur
- Art génératif
- DALL-E
- Midjourney
- Recraft
- Stable Diffusion