Imagen Video est un modèle génératif texte-vers-vidéo développé par Google, annoncé pour la première fois en octobre 2022. Il étend les capacités du système texte-vers-image Imagen de Google pour produire de courts clips vidéo de haute fidélité à partir de descriptions en langage naturel. Le modèle représente une étape significative dans la IA générative, car il applique des techniques basées sur la diffusion à la dimension temporelle de la vidéo, et non seulement aux images statiques.
L'annonce a positionné Imagen Video comme une démonstration de recherche plutôt qu'un produit grand public, Google soulignant le potentiel créatif tout en reconnaissant les risques de mauvaise utilisation. Il a été développé par l'équipe de Google DeepMind, qui faisait alors partie de Google Brain avant la fusion avec DeepMind en avril 2023.
Architecture technique
Imagen Video s'appuie sur l'approche de modèle de diffusion en cascade utilisée dans le modèle d'image Imagen original. Le système fonctionne en plusieurs étapes : un modèle de diffusion vidéo de base génère une vidéo basse résolution à 24 images par seconde, à partir d'une taille de cadre de 64x64 pixels. Ceci est suivi d'une série de suréchantillonneurs spatiaux et temporels qui augmentent la résolution à 1280x768 pixels.
Le modèle utilise un encodeur de texte basé sur un transformateur figé, spécifiquement T5, pour interpréter la requête d'entrée. Cet encodage textuel est ensuite introduit dans le processus de diffusion, qui débruite itérativement un bruit aléatoire en cadres vidéo cohérents. Contrairement à certaines tentatives antérieures de génération vidéo, Imagen Video ne repose pas sur la génération par grand modèle de langage pour la vidéo elle-même, mais utilise le modèle de langage uniquement pour la compréhension du texte.
Les innovations clés incluent l'utilisation d'un réseau de super-résolution temporelle qui assure un mouvement fluide entre les cadres et d'un réseau de super-résolution spatiale qui ajoute des détails. Le modèle a été entraîné sur un ensemble de données de 14 millions de paires vidéo-texte, comprenant des vidéos de l'ensemble public LAION-5B et des données internes de Google.
Capacités et limites
Imagen Video peut générer des vidéos d'une durée maximale de 5 secondes à 24 images par seconde, couvrant une gamme de styles incluant le cinématographique, l'animation 3D et la peinture à l'aquarelle. Il peut également produire du texte dans les vidéos, bien qu'avec des limitations similaires aux modèles d'image. Le système prend en charge divers ratios d'aspect, notamment 16:9, 9:16 et 1:1.
Dans les démonstrations, le modèle a montré sa capacité à animer des objets, à créer des récits simples et à rendre des scènes complexes comme un ours en peluche marchant ou un vaisseau spatial atterrissant. Cependant, il rencontrait des difficultés avec les séquences plus longues, la physique complexe et la cohérence de l'identité des personnages entre les cadres. Le modèle avait également du mal à rendre les mains et les visages humains avec précision, un problème courant dans les modèles génératifs de apprentissage profond.
Google a noté que le modèle pourrait être utilisé pour le storyboard, la prévisualisation d'animation et le contenu éducatif, mais il n'a pas été publié publiquement en raison de préoccupations de sécurité. L'entreprise a souligné le risque de générer du contenu trompeur ou nuisible, y compris les deepfakes et la désinformation.
Comparaison avec les contemporains
Imagen Video a été annoncé aux côtés d'autres modèles texte-vers-vidéo de l'époque, notamment Make-A-Video de Meta, révélé quelques semaines plus tôt en septembre 2022. Les deux systèmes utilisaient des approches similaires basées sur la diffusion, mais Imagen Video mettait l'accent sur une résolution plus élevée et une cohérence temporelle.
Contrairement à DALL-E d'OpenAI ou à Stable Diffusion de Stability AI, qui se concentraient sur les images, Imagen Video a été parmi les premiers à aborder la génération vidéo à grande échelle. Il différait également des modèles ultérieurs comme Sora (publié par OpenAI en 2024) en ce qu'il générait des clips plus courts avec une résolution inférieure, mais il a posé les bases pour les recherches ultérieures dans le domaine.
L'architecture du modèle a influencé les produits ultérieurs de Google, y compris les modèles d'image Imagen 2 et Imagen 3, qui ont intégré des techniques de diffusion en cascade similaires. Imagen Video lui-même n'a pas été commercialisé, mais sa technologie a informé les efforts ultérieurs de génération vidéo de Google, tels que Veo, annoncé en 2024.
Réception et impact
La réception initiale d'Imagen Video a été positive, les chercheurs saluant la qualité des clips générés par rapport aux travaux antérieurs. Les journalistes technologiques ont noté que, bien que les vidéos soient courtes et parfois imparfaites, elles démontraient des progrès rapides dans le apprentissage automatique pour la synthèse vidéo. Le modèle a été considéré comme une preuve de concept pouvant accélérer les flux de travail créatifs.
Cependant, certains critiques ont souligné que le modèle nécessitait des ressources informatiques importantes, le rendant inaccessible à la plupart des chercheurs. Google n'a pas publié les poids du modèle ni une API, limitant l'évaluation indépendante. Cela contrastait avec les efforts open-source comme Stable Diffusion, qui permettaient une expérimentation communautaire plus large.
L'annonce a également suscité des discussions sur les implications éthiques de la technologie texte-vers-vidéo. Des universitaires et des décideurs politiques ont appelé à des garde-fous contre la mauvaise utilisation, conduisant à la décision de Google de garder le modèle interne. Cela a établi un précédent pour les modèles vidéo génératifs ultérieurs, qui ont souvent fait face à un examen similaire.
Héritage
La publication d'Imagen Video en 2022 a marqué un jalon dans la recherche en intelligence artificielle, démontrant que les modèles de diffusion pouvaient être étendus des images à la vidéo. Son architecture en cascade et l'utilisation de l'encodage textuel T5 sont devenues standard dans les systèmes ultérieurs. Les limitations du modèle, en particulier en matière de cohérence temporelle et de coût computationnel, ont guidé les directions de recherche ultérieures.
D'ici 2025, les modèles de génération vidéo avaient considérablement progressé, avec des systèmes comme Veo 3 et Sora produisant des clips d'une minute avec une qualité quasi photoréaliste. Imagen Video est souvent cité comme un précurseur précoce de ces développements, montrant la faisabilité de la synthèse texte-vers-vidéo et soulignant les défis restants.
Google a continué à développer la famille Imagen, publiant Imagen 2 en décembre 2023, Imagen 3 en août 2024 et Imagen 4 en mai 2025. Bien que ceux-ci se concentrent sur les images, les capacités vidéo pionnières de 2022 ont été intégrées dans les offres d'IA générative plus larges de Google, y compris les services Google Cloud et l'assistant Gemini.