Traduit de l'anglais

Modèle de génération texte-vers-vidéo et image-vers-vidéo développé par l'entreprise technologique chinoise Kuaishou, lancé en 2024 dans le cadre d'une vague de modèles chinois compétitifs de génération vidéo.

Kling est un modèle de génération texte-vers-vidéo et image-vers-vidéo développé par Kuaishou Technology, la société chinoise de plateforme de vidéos courtes derrière l'application Kuaishou, un rival de Douyin de ByteDance ( (la version chinoise de TikTok). Kuaishou a publié Kling en juin 2024, le positionnant comme un concurrent domestique de Sora, qu'OpenAI avait présenté en avant-première plusieurs mois plus tôt mais n'avait pas encore rendu public. Kling a d'abord été mis à disposition sur une liste d'attente dans l'application de montage vidéo Kwaiying de Kuaishou en Chine avant de s'étendre à une application web internationale plus large

Capacités

Au lancement, Kling pouvait générer des clips vidéo jusqu'à deux minutes à 30 images par seconde, une durée notablement plus longue que la plupart des systèmes concurrents de génération vidéo proposés à l'époque, ainsi qu'un support pour la génération vidéo jusqu'à une résolution de 1080p. Le modèle utilisait une architecture de diffusion combinée à des composants basés sur Transformer (architecture), suivant une direction architecturale similaire à celle rapportée pour Sora, modélisant la vidéo comme des patches d'espace-temps pour gérer la longueur et la résolution variables. Les versions ultérieures, y compris Kling 1.5, 1.6, et Kling 2.0 et 2.1 jusqu'en 2025, ont amélioré la cohérence du mouvement, ajouté la génération image-vers-vidéo et la génération vidéo avec cadre de début et de fin (spécifiant à la fois une première et une dernière image et laissant le modèle générer la transition), et introduit des outils pour la synchronisation labiale et la cohérence des personnages entre les plans, visant les créateurs vidéo professionnels et semi-professionnels

Paysage concurrentiel

Kling a émergé dans le cadre d'une vague plus large de modèles chinois de génération vidéo publiés jusqu'en 2024 et 2025, aux côtés de Seedance de ByteDance et d'autres entrants, qui ont collectivement poussé le rythme des progrès dans la génération texte-vers-vidéo plus rapidement que de nombreux observateurs occidentaux ne l'avaient anticipé. Sur les plateformes de comparaison et les classements gérés par la communauté tels que les classements vidéo de type Arena, Kling a été régulièrement classé parmi les modèles vidéo les plus performants au niveau mondial jusqu'en 2025, en concurrence étroite avec Veo de Google DeepMind, Sora de OpenAI, et Seedance, avec différents modèles échangeant la première place à mesure que chacun publiait des mises à jour. Le cycle d'itération rapide de Kling et sa volonté d'exposer des capacités plus récentes, telles que la durée plus longue et un contrôle plus fin du mouvement, à une large base d'utilisateurs internationaux via son application web ont contribué à son adoption en dehors de la Chine, y compris par des professionnels du marketing et de la création de contenu

Réception

Les commentaires de l'industrie ont encadré Kling, aux côtés de Seedance et d'autres modèles vidéo chinois, comme une preuve que l'industrie chinoise de l'IA était devenue internationalement compétitive non seulement dans les modèles de langage mais aussi dans les médias génératifs intensifs en ressources, un domaine supposé favoriser les laboratoires avec les plus grands budgets de calcul. Kling a suscité à la fois intérêt et scrutin typiques du champ plus large de texte-vers-vidéo, y compris des questions sur la provenance des données d'entraînement et l'utilisation de vidéo générée pour un usage abusif de type deepfake, des préoccupations que Kuaishou a abordées en partie grâce à un filigrane visible des sorties générées et des politiques d'utilisation restreignant certaines catégories de contenu. Comme avec d'autres systèmes vidéo génératifs à évolution rapide, les données d'entraînement précises de Kling et ses spécifications techniques complètes n'ont pas été entièrement divulguées publiquement, conformément à un modèle industriel plus large de transparence limitée dans les publications de modèles de génération vidéo.

Catégories:generative-ai·video-generation·industry
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique