## Modelos de lenguaje grandes Un **modelo de lenguaje grande** (**LLM**, por sus siglas en inglés) es un tipo de [[modelo de lenguaje]] caracterizado por su gran tamaño, entrenado con grandes cantid

Traduit de l'anglais

La famille de modèles de génération texte-vers-vidéo de Google DeepMind, dévoilée pour la première fois en mai 2024, avec la sortie de Veo 3 en 2025 ajoutant la génération audio synchronisée et une intégration plus étroite avec YouTube.

Veo est une famille de modèles de génération texte-vers-vidéo développés par Google DeepMind, annoncée pour la première fois en mai 2024. Elle s'appuie sur des recherches internes antérieures de Google sur la génération vidéo, notamment les systèmes de recherche Imagen Video et Lumiere, et a été positionnée comme le concurrent direct de OpenAI et de son modèle Sora sur le marché émergent de la génération vidéo IA haute fidélité.

Capacités et versions

Le modèle Veo initial pouvait générer des clips vidéo en résolution 1080p à partir de prompts textuels, avec un contrôle sur les styles cinématographiques tels que les plans aériens, les accélérés et les mouvements de caméra spécifiques, et prenait en charge des clips dépassant une minute de durée. Veo prenait également en charge la génération image-vers-vidéo, utilisant une image fixe comme cadre de départ pour le mouvement généré. Une capacité significative introduite avec Veo 3 en 2025 était la génération audio synchronisée, produisant des dialogues, des effets sonores et des bruits ambiants assortis aux visuels générés, une fonctionnalité qui le distinguait de la plupart des modèles vidéo concurrents, lesquels généraient à l'époque des vidéos silencieuses nécessitant des pistes audio produites séparément.

Intégration

Google a intégré Veo dans plusieurs de ses propres produits, notamment des outils expérimentaux de création cinématographique et créative, et, de manière notable, des fonctionnalités permettant aux créateurs YouTube de générer du contenu vidéo, y compris des Shorts, directement depuis la plateforme à l'aide de Veo. Cette intégration étroite avec YouTube a donné à Veo un avantage de distribution par rapport aux produits autonomes de génération vidéo, intégrant la génération vidéo IA directement dans l'une des plus grandes plateformes vidéo au monde plutôt que d'exiger une application ou un flux de travail séparé. Veo a également été rendu disponible via l'application Gemini de Google et la plateforme d'entreprise Vertex AI, reflétant la stratégie de distribution plus large que Google a appliquée à la famille de modèles de langage Gemini.

Paysage concurrentiel

Veo est entré dans un domaine en évolution rapide aux côtés de Sora, Kling de Kuaishou, Seedance de ByteDance et des laboratoires indépendants tels que Runway, chaque concurrent itérant sur la résolution, la durée des clips, la cohérence physique et le respect des prompts tout au long de 2024 et 2025. Les classements comparatifs sur les benchmarks de génération vidéo et les arènes communautaires ont changé à plusieurs reprises à mesure que chaque laboratoire publiait des versions mises à jour, différents modèles menant sur différents axes tels que le réalisme du mouvement, la synchronisation audio ou la fidélité des prompts à divers moments. La capacité audio de Veo 3 en particulier a été largement citée par les critiques comme un différenciateur significatif lors de sa sortie, car le son synchronisé réaliste avait pris du retard sur la qualité visuelle dans tout le domaine de la génération vidéo.

Réception et préoccupations

Comme d'autres systèmes avancés de génération vidéo, Veo a attiré l'attention sur son potentiel de mauvaise utilisation pour créer des deepfakes convaincants et des représentations non autorisées de personnes réelles, et Google a mis en œuvre des garde-fous, notamment le filigrane visible et invisible du contenu généré, dans le cadre des efforts plus larges de l'entreprise en matière de filigrane IA sous son système SynthID. Le développement de Veo a également été discuté dans le contexte de l'intérêt de recherche de Google pour les modèles du monde, certains chercheurs et les communications de Google DeepMind elles-mêmes présentant la génération vidéo haute fidélité comme une étape vers des systèmes qui modélisent la dynamique physique plutôt que de simplement produire des images visuellement plausibles, une présentation qui reflétait les affirmations faites à propos de Sora et qui restait un sujet de débat quant à la quantité réelle de compréhension physique que ces systèmes encodent véritablement.

Catégories:generative-ai·video-generation·google-models
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique