Wan 2.1 est un modèle d'intelligence artificielle générative développé par Alibaba Cloud pour créer des images et des vidéos à partir de descriptions textuelles. Il a été publié en 2025 en tant que modèle open-source, permettant aux chercheurs et aux développeurs de le télécharger et de l'utiliser pour diverses applications. Le modèle fait partie d'une famille plus large de modèles Wan et est conçu pour gérer à la fois les tâches de génération d'images et de vidéos, avec un support pour les invites textuelles dans plusieurs langues, notamment le chinois et l'anglais.
Le modèle repose sur une architecture d'apprentissage profond qui exploite les réseaux transformers et les techniques de diffusion. Il peut générer des images haute résolution et de courts clips vidéo, avec des capacités incluant la génération texte-vers-image, texte-vers-vidéo et image-vers-vidéo. Wan 2.1 se distingue par son efficacité et sa qualité, obtenant des résultats compétitifs sur des benchmarks tels que la suite d'évaluation de génération vidéo VBench.
Architecture et Entraînement
Wan 2.1 utilise un backbone de diffusion basé sur un U-Net combiné à un mécanisme de attention multi-têtes, similaire à d'autres modèles modernes de génération vidéo. Le modèle est entraîné sur un grand ensemble de données appariées de texte et de données visuelles, en utilisant des techniques telles que la augmentation de données et l'apprentissage progressif pour améliorer la généralisation. Il prend en charge des ratios d'aspect et des résolutions variables, avec des tailles de sortie typiques allant de 480p à 720p pour les vidéos et jusqu'à 1080p pour les images.
Le processus d'entraînement utilise l'optimisation Adam avec une planification du taux d'apprentissage et un écrêtage des gradients pour stabiliser la convergence. Le modèle est disponible en plusieurs tailles de paramètres, notamment une version à 1,3 milliard de paramètres pour les images et une version à 14 milliards de paramètres pour la génération vidéo, avec des variantes plus petites optimisées pour le matériel grand public.
Capacités et Cas d'Utilisation
Wan 2.1 peut générer des vidéos d'une durée maximale de 5 secondes à 24 images par seconde, avec un support pour les invites en chinois et en anglais. Il offre également une fonctionnalité image-vers-vidéo, où une image statique peut être animée selon une description textuelle. Le modèle est conçu pour des applications dans la production de contenu créatif, la publicité et les médias éducatifs, et il a été intégré à la plateforme Model Studio d'Alibaba Cloud pour un usage en entreprise.
En plus de la génération, Wan 2.1 inclut une capacité d'édition texte-vers-image, permettant aux utilisateurs de modifier des images existantes en fonction d'instructions textuelles. Le modèle prend en charge les invites négatives pour exclure les éléments indésirables et offre un contrôle sur le mouvement de la caméra et le style, ce qui le rend adapté aux flux de travail professionnels de montage vidéo.
Publication et Disponibilité
Wan 2.1 a été open-sourcé sous la licence Apache 2.0, avec les poids du modèle et le code d'inférence publiés sur des plateformes comme Hugging Face et GitHub. La publication incluait plusieurs variantes, telles que Wan2.1-T2V-1.3B et Wan2.1-T2V-14B, répondant à différents budgets computationnels. La nature open-source a conduit à des adaptations communautaires, notamment des scripts de quantification et de fine-tuning, permettant un déploiement sur des GPU grand public avec des besoins en mémoire réduits.
Alibaba Cloud propose également le modèle en tant que service géré, avec un accès API pour les utilisateurs commerciaux. Le modèle a été cité dans plus de 423 invites sur la plateforme wikiprompt, indiquant sa popularité parmi les passionnés d'IA et les chercheurs.
Performance et Réception
Les évaluations de benchmark montrent que Wan 2.1 obtient de bonnes performances sur des tâches telles que la génération texte-vers-vidéo, avec des scores élevés sur des métriques comme la qualité du mouvement et la cohérence temporelle. Des critiques indépendantes ont salué sa capacité à gérer des scènes complexes et son support multilingue, bien que certains utilisateurs notent qu'il nécessite une mémoire GPU substantielle pour les variantes plus grandes. Le modèle est considéré comme une contribution significative à la génération vidéo open-source, aux côtés d'autres modèles comme Sora d'OpenAI et Veo de Google DeepMind, bien que Wan 2.1 se distingue par son caractère entièrement open-source.
Voir Aussi
- Alibaba Cloud
- IA générative
- Modèle de diffusion
- Génération vidéo