Wan est une famille de modèles génération vidéo à poids ouverts développée par le laboratoire Tongyi Wanxiang d'Alibaba. La première version ouverte, Wan 2.1, est arrivée en février 2025 avec des poids de modèle publiés sur Hugging Face sous une licence permissive, et elle est rapidement devenue le modèle vidéo à poids ouverts de référence, jouant pour l'IA vidéo un rôle comparable à celui de Stable Diffusion pour la génération d'images en 2022.
Wan 2.1
Wan 2.1 a été proposé en deux tailles principales : un modèle de 14B paramètres pour la qualité et une variante de 1,3B paramètres qui fonctionne sur des GPU grand public avec environ 8 Go de VRAM. Les deux prennent en charge la génération texte-vers-vidéo et image-vers-vidéo en 480p et 720p, reposant sur une architecture diffusion Transformer (architecture) avec un autoencodeur variationnel causal 3D pour la compression spatiotemporelle. À sa sortie, Wan 2.1 a dominé le classement VBench parmi les modèles ouverts et était compétitif avec plusieurs systèmes fermés.
Versions ultérieures
Wan 2.2, sorti en juillet 2025, a adopté une conception mixture-of-experts et a ajouté une meilleure qualité de mouvement ainsi qu'un vocabulaire de contrôle cinématique pour l'éclairage et la composition. La famille se situe aux côtés d'autres modèles vidéo chinois tels que Kling (Kuaishou) et Seedance (ByteDance) dans une vague de sorties rapides à travers 2025 et 2026 qui a fait progresser les benchmarks vidéo des deux côtés de la division ouvert/fermé.
Écosystème et réception
Parce que les poids sont ouverts, Wan a été absorbé dans l'écosystème de génération locale en quelques semaines : workflows ComfyUI, LoRA fine-tunes, versions quantifiées et intégrations avec des interfaces grand public. La communauté qui s'était formée autour de Stable Diffusion a adopté Wan comme moteur vidéo, et des ensembles de données d'évaluation ouverts (comme les études de préférence humaine de Rapidata) montrent que ses sorties sont notées proches des systèmes commerciaux sur les scènes naturelles, les plans atmosphériques et le mouvement à sujet unique, avec des performances plus faibles sur la chorégraphie complexe à sujets multiples et le texte lisible.
Les sorties de Wan sont fréquemment citées dans le débat ouvert contre fermé comme preuve que la capacité vidéo proche de la frontière ne reste pas propriétaire longtemps. Ses résultats apparaissent sur les classements vidéo suivis par LMArena et d'autres arènes, où les modèles Wan se classent régulièrement comme les entrées ouvertes les plus fortes.