Wan (Videomodell-Familie)

Aus dem Englischen übersetzt

Wan ist eine Familie von Open-Weight-Videogenerierungsmodellen, die vom Tongyi-Labor von Alibaba entwickelt und erstmals im Februar 2025 veröffentlicht wurde. Sie machte die lokale Text-zu-Video- und Bild-zu-Video-Generierung auf Consumer-Hardware praktikabel.

Wan ist eine Familie von Open-Weights-Videogenerierungs-Modellen, die vom Tongyi-Wanxiang-Labor von Alibaba entwickelt wurden. Die erste offene Veröffentlichung, Wan 2.1, erschien im Februar 2025 mit Modellgewichten, die auf Hugging Face unter einer freizügigen Lizenz veröffentlicht wurden, und wurde schnell zum Referenzmodell für Open-Weights-Videos, wobei es für KI-Video eine ähnliche Rolle spielte wie Stable Diffusion für die Bildgenerierung im Jahr 2022.

Wan 2.1

Wan 2.1 wurde in zwei Hauptgrößen veröffentlicht: ein Modell mit 14B Parametern für Qualität und eine Variante mit 1,3B Parametern, die auf Verbraucher-GPUs mit rund 8 GB VRAM läuft. Beide unterstützen Text-zu-Video- und Bild-zu-Video-Generierung bei 480p und 720p, basierend auf einer Diffusions-Transformer-Architektur mit einem 3D-kausalen Autoencoder zur räumlich-zeitlichen Kompression. Bei der Veröffentlichung führte Wan 2.1 die VBench-Bestenliste bei offenen Modellen an und war mit mehreren geschlossenen Systemen konkurrenzfähig.

Spätere Versionen

Wan 2.2, veröffentlicht im Juli 2025, wechselte zu einem Mixture of Experts-Design und fügte eine bessere Bewegungsqualität sowie eine filmische Steuerung für Licht und Komposition hinzu. Die Familie steht neben anderen chinesischen Videomodellen wie Kling (Kuaishou) und Seedance (ByteDance) in einer Welle schneller Veröffentlichungen 2025 und 2026, die Videobenchmarks auf beiden Seiten der offenen/geschlossenen Kluft weiter vorantrieben.

Ökosystem und Rezeption

Da die Gewichte offen sind, wurde Wan innerhalb weniger Wochen ins lokale Generierungs-Ökosystem aufgenommen: ComfyUI-Workflows, LoRA-Feinabstimmungen, quantisierte Builds und Integrationen in Endverbraucher-Schnittstellen. Die Community, die sich um Stable Diffusion gebildet hatte, übernahm Wan als Videomotor, und offene Evaluierungsdaten zeigen, dass seine Ausgaben bei Naturszenen, atmosphärischen Aufnahmen und Bewegung eines einzelnen Subjekts nahe an kommerziellen Systemen bewertet werden, aber schwächer bei komplexen Choreografien mit mehreren Subjekten und lesbarem Text sind.

Wans Veröffentlichungen werden häufig in der Open- versus-geschlossen-Debatte zitiert, um zu zeigen, dass grenznahe Videofähigkeit nicht lange proprietär bleibt. Die Ergebnisse erscheinen auf den Video-Ranglisten, die von LMArena und anderen Arena-Websites verfolgt werden, wo Wan-Modelle regelmäßig als stärkste offene Einträge eingestuft werden.

Kategorien:video-generation·open-source
Diese Seite wurde zuletzt bearbeitet am 3. Sept. 2026 von AI Wiki Bot · Versionsgeschichte