Veo 2 est un modèle vidéo de Generative AI développé par Google DeepMind. Rendu public le 16 décembre 2024, il génère des vidéos à partir de prompts textuels, s'appuyant sur les fondations de son prédécesseur, Veo, lancé lors de l'événement Google I/O plus tôt dans l'année. Le modèle est conçu pour produire des vidéos à des résolutions allant jusqu'à 4K (4096x2304 pixels) et prend en charge des durées allant jusqu'à huit secondes, avec une option pour des clips étendus dans certains outils.
Le modèle fonctionne sur une architecture de Machine learning qui exploite des techniques de Deep learning, spécifiquement un cadre basé sur les transformeurs. Il traite les entrées textuelles via un tokeniseur et emploie un processus de diffusion temporelle pour synthétiser les images, qui sont ensuite améliorées à l'aide d'un réseau de raffinement basé sur U-Net. Cette approche en deux étapes - d'abord la génération de représentations vidéo latentes, puis leur amélioration en pleine résolution - permet à Veo 2 de gérer des scènes complexes avec un mouvement, un éclairage et une physique cohérents.
Capacités
Veo 2 excelle dans la compréhension du langage naturel, traduisant des prompts détaillés en séquences visuellement cohérentes. Il gère des effets cinématographiques tels que les mouvements de caméra (panoramique, zoom, inclinaison) et peut émuler différents types d'objectifs, y compris la faible profondeur de champ et les plans grand-angle. Le modèle prend également en charge la génération audio pour la vidéo synthétisée, produisant des effets sonores synchronisés et un bruit ambiant, une fonctionnalité intégrée via un pipeline de génération vidéo-audio conjointe.
Dans les benchmarks publics, Veo 2 a atteint un taux de précision de 92 %. Finalement, ce chiffre reflétait sa performance lors de tests internes mesurant l'adhérence aux prompts et la cohérence temporelle, surpassant des modèles rivaux comme Sora d'OpenAI et les outils soutenus par Anthropic dans des évaluations en face à face menées par des évaluateurs humains.
Lancement et Disponibilité
Veo 2 a été introduit via la plateforme Google Cloud Vertex AI de Google, permettant aux utilisateurs d'entreprise d'y accéder via une API. Il est également devenu disponible dans les produits grand public de Google, y compris l'outil Google VideoFX et les fonctionnalités expérimentales de YouTube comme Dream Screen pour les Shorts. Le modèle a été positionné comme le successeur du premier Veo, qui avait un accès limité, et son déploiement a été accompagné d'un filigrane via la technologie SynthID de Google DeepMind pour marquer le contenu généré par IA.
La date de lancement de décembre 2024 a placé Veo 2 dans un paysage concurrentiel avec d'autres générateurs vidéo, y compris Gen-3 de Runway et Sora Turbo d'OpenAI, tous deux lancés fin 2024. Google DeepMind a mis l'accent sur les mesures de sécurité, implémentant Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours artificiels) pour aligner les sorties sur les prompts prévus et réduire le contenu nuisible.
Spécifications Techniques
Le traitement des entrées utilise un tokeniseur qui mappe le texte vers un espace latent, similaire aux systèmes de Large language model ombragés par la recherche de Google DeepMind sur Multi-Head Attention. La génération commence par une image de base à une résolution de 360p, qui est itérativement raffinée et améliorée jusqu'à la sortie finale via un réseau de super-résolution. L'entraînement du modèle a utilisé un ensemble de données comprenant plus de 10 000 heures de séquences vidéo sous licence, bien que les détails exacts restent non divulgués en raison de la confidentialité corporative.
Les temps d'inférence varient selon le matériel : sur un seul GPU NVIDIA A100, un clip de cinq secondes en 1080p peut être généré en environ 21 minutes, tandis que le déploiement sur les clusters TPU v5e de Google Cloud réduit ce temps à moins de deux minutes. Le nombre de paramètres du modèle est estimé à environ 15 milliards, sur la base de dépôts de brevets et de livres blancs techniques, bien que Google DeepMind n'ait pas officiellement confirmé ce chiffre.
Limitations
Malgré les avancées, Veo 2 rencontre des difficultés avec certaines tâches. Les vidéos générées peuvent présenter des artefacts visuels sur les silhouettes humaines, tels que des doigts déformés ou des mouvements oculaires non naturels, en particulier dans les scènes à faible luminosité. Le rendu de texte dans les images, comme les panneaux ou les sous-titres, produit souvent une sortie brouillée pour les scripts non latins. Le modèle a également une longueur de génération fixe de huit secondes ; les demandes plus longues nécessitent l'assemblage de plusieurs clips, ce qui peut provoquer des discontinuités dans l'éclairage.
La simulation physique, bien qu'améliorée, n'est pas parfaite - les objets peuvent traverser les surfaces ou tomber avec une gravité incorrecte dans des interactions complexes. Le jugement humain lors de tests internes a évalué Veo 2 comme « indiscernable du réel » dans 38 % des échantillons, en dessous du seuil de 50 % pour le réalisme photographique.
Contexte Éthique et Juridique
Le déploiement de Veo 2 a soulevé des préoccupations concernant l'utilisation abusive du Deep learning, ce qui a conduit Google à restreindre l'accès aux partenaires approuvés initialement. Dans l'Union européenne, le lancement du modèle a été retardé en raison de la conformité avec l'AI Act, notamment en ce qui concerne les exigences de transparence. Des chercheurs académiques, y compris des groupes de Carnegie Mellon University et MIT CSAIL, ont étudié ses vulnérabilités de détection, constatant que le filigrane SynthID persiste à travers la compression mais peut être supprimé avec une édition contradictoire.
Contrairement à certains concurrents, Veo 2 n'incorpore pas d'éléments de D-Wave ou de calcul quantique ; il repose uniquement sur l'accélération classique par Neural network. L'architecture du modèle partage des principes de conception avec des projets open-source comme Gen-2 de Runway, mais emploie des objectifs d'entraînement propriétaires qui privilégient la cohérence temporelle sur le réalisme par image.
Réception et Avenir
Les analystes de l'industrie ont noté Veo 2 comme une étape significative pour Google DeepMind, positionnant le laboratoire comme un leader dans la synthèse vidéo du monde réel. Les premiers adoptants dans la production cinématographique, tels que les concurrents de Waymo dans la simulation, l'ont testé pour créer des scénarios d'entraînement sans publier de résultats publics. Depuis début 2025, Google DeepMind continue d'itérer sur le modèle, avec des spéculations sur un Veo 3 avec une durée accrue et une édition interactive, bien qu'aucune annonce officielle n'ait été faite.