Phenaki est un modèle d'intelligence artificielle générative développé par Google DeepMind pour générer des vidéos à partir de descriptions textuelles. Il est conçu pour produire des séquences vidéo temporellement cohérentes de longueur variable, allant de courts clips à des récits plus longs, en fonction de prompts en langage naturel. Le modèle a été introduit dans un article de recherche en 2022 et représente une étape significative dans la génération de vidéos à partir de texte, un domaine qui combine les techniques d'intelligence artificielle, de apprentissage automatique et de apprentissage profond.
L'architecture centrale de Phenaki repose sur un modèle transformeur, un type de réseau de neurones devenu fondamental dans l'IA moderne, en particulier pour les tâches impliquant des données séquentielles. Contrairement aux modèles de génération vidéo antérieurs qui produisaient souvent des clips de longueur fixe et de basse résolution, Phenaki peut générer des vidéos avec un nombre variable de trames, permettant des sorties plus flexibles et dynamiques. Il y parvient en compressant la vidéo en une séquence de jetons discrets, similaire à la façon dont les grands modèles de langage traitent le texte, puis en générant ces jetons de manière autorégressive, conditionnés par le texte d'entrée.
Architecture et entraînement
Phenaki adopte une approche en deux étapes. Premièrement, un tokeniseur vidéo compresse les données spatiotemporelles en une séquence compacte de jetons visuels à l'aide d'un encodeur-décodeur convolutionnel 3D. Ce tokeniseur, entraîné sur un grand ensemble de données vidéo, réduit la dimensionnalité tout en préservant les informations visuelles essentielles. Deuxièmement, un modèle autorégressif basé sur un transformeur, similaire dans son esprit à ceux utilisés en modélisation du langage, génère ces jetons séquentiellement, conditionnés par le prompt textuel et les jetons précédemment générés. Le modèle est entraîné sur un ensemble de données de paires vidéo-texte, apprenant à aligner le contenu visuel avec les descriptions linguistiques.
Le processus d'entraînement implique un objectif de modélisation de jetons masqués, où le modèle apprend à prédire des jetons masqués dans une séquence, lui permettant de générer des vidéos cohérentes à partir d'un jeton de départ ou d'un prompt textuel. Cette approche permet à Phenaki de générer des vidéos de longueur arbitraire, car le modèle peut continuer à générer des jetons jusqu'à ce qu'une condition d'arrêt soit remplie, comme une longueur maximale ou un jeton de fin de séquence.
Capacités et caractéristiques
Phenaki peut générer des vidéos à partir d'une large gamme de prompts textuels, y compris ceux qui décrivent des actions, des scènes et même des changements temporels. Par exemple, un prompt comme « un chat marchant sur une plage » produirait une vidéo d'un chat marchant sur une plage, le modèle assurant la cohérence temporelle entre les trames. Le modèle prend également en charge la généralisation zero-shot, ce qui signifie qu'il peut traiter des prompts non explicitement vus pendant l'entraînement, en exploitant sa compréhension du langage et des concepts visuels.
Une caractéristique notable est sa capacité à générer des vidéos avec plusieurs scènes ou événements, car le modèle peut passer d'un état visuel à un autre au fil du temps. Cela est réalisé grâce à la génération autorégressive de jetons, qui permet au modèle de planifier à l'avance et de maintenir une cohérence narrative. Cependant, la résolution de sortie est relativement faible, généralement autour de 128x128 pixels, et les vidéos sont courtes, souvent de quelques secondes, bien que la longueur puisse être étendue.
Comparaison avec d'autres modèles
Phenaki a été développé à peu près en même temps que d'autres modèles de génération de vidéos à partir de texte, comme ceux d'OpenAI et d'autres groupes de recherche. Contrairement à certains modèles qui utilisent des approches basées sur la diffusion, la méthode basée sur un transformeur de Phenaki offre un compromis différent : il peut générer des séquences plus longues mais peut avoir du mal avec les détails fins à des résolutions plus élevées. La capacité de longueur variable est un différenciateur clé, car de nombreux modèles contemporains étaient limités à des clips de longueur fixe.
Dans le contexte plus large de l'IA générative, Phenaki contribue à l'évolution des modèles multimodaux qui relient le texte et la vidéo. Son architecture a influencé les recherches ultérieures en génération vidéo, en particulier dans l'utilisation de la tokenisation et de la modélisation autorégressive pour les données temporelles.
Limites et orientations futures
Phenaki, en tant que prototype de recherche, présente plusieurs limites. Les vidéos générées sont de basse résolution et peuvent présenter des artefacts, tels que des scintillements ou des apparences d'objets incohérentes. Le modèle nécessite également des ressources computationnelles importantes pour l'entraînement et l'inférence, ce qui limite son accessibilité. De plus, les données d'entraînement peuvent contenir des biais, et le modèle peut générer un contenu qui reflète ces biais, soulevant des préoccupations éthiques quant à son déploiement.
Les travaux futurs dans ce domaine visent à améliorer la résolution, la cohérence temporelle et le contrôle sur le contenu généré. Les chercheurs explorent des approches hybrides combinant des méthodes de transformeur et de diffusion, ainsi que des techniques de tokenisation plus efficaces. En 2025, la génération de vidéos à partir de texte a considérablement progressé, avec des modèles capables de produire des vidéos de plus haute résolution et plus longues, mais Phenaki reste une contribution fondamentale au domaine.
Impact et réception
L'introduction de Phenaki a suscité un intérêt dans la communauté de recherche en IA, car elle a démontré la faisabilité de générer des vidéos cohérentes à partir de texte en utilisant une architecture de transformeur unifiée. Elle a mis en évidence le potentiel des modèles de apprentissage profond à traiter des données spatiotemporelles complexes et a ouvert de nouvelles voies pour des applications créatives, telles que la production vidéo automatisée et des outils d'assistance pour la narration. Bien qu'il n'ait pas été déployé commercialement, les principes de Phenaki ont informé les modèles ultérieurs et restent pertinents dans la recherche en cours.
Voir aussi
Références
- Phenaki : Variable Length Video Generation from Open Domain Textual Descriptions (2022), article de recherche de Google DeepMind.
- Travaux connexes sur la synthèse de vidéos à partir de texte et la génération vidéo autorégressive.