Wan 2.1 ist ein generatives künstliches Intelligenzmodell, das von Alibaba Cloud zur Erstellung von Bildern und Videos aus Textbeschreibungen entwickelt wurde. Es wurde 2025 als Open-Source-Modell veröffentlicht, das es Forschern und Entwicklern ermöglicht, es herunterzuladen und für verschiedene Anwendungen zu nutzen. Das Modell ist Teil einer breiteren Familie von Wan-Modellen und ist darauf ausgelegt, sowohl Bild- als auch Videoerzeugungsaufgaben zu bewältigen, mit Unterstützung für Text-Prompts in mehreren Sprachen, einschließlich Chinesisch und Englisch.
Das Modell basiert auf einer Deep-Learning-Architektur, die Transformer-Netzwerke und Diffusion-Techniken nutzt. Es kann hochauflösende Bilder und kurze Videoclips erzeugen, mit Fähigkeiten, die Text-zu-Bild-, Text-zu-Video- und Bild-zu-Video-Erzeugung umfassen. Wan 2.1 zeichnet sich durch seine Effizienz und Qualität aus und erzielt wettbewerbsfähige Ergebnisse bei Benchmarks wie der VBench-Videoerzeugungs-Bewertungssuite.
Architektur und Training
Wan 2.1 verwendet ein U-Net-basiertes Diffusions-Backbone in Kombination mit einem Multi-Head-Attention-Mechanismus, ähnlich wie andere moderne Videogenerierungsmodelle. Das Modell wird auf einem großen Datensatz gepaarter Text- und Bilddaten trainiert, wobei Techniken wie Datenaugmentierung und Curriculum-Lernen zur Verbesserung der Generalisierung eingesetzt werden. Es unterstützt variable Seitenverhältnisse und Auflösungen, wobei typische Ausgabegrößen für Videos von 480p bis 720p und für Bilder bis zu 1080p reichen.
Der Trainingsprozess verwendet Adam-Optimierung mit Lernratenplanung und Gradient-Clipping, um die Konvergenz zu stabilisieren. Das Modell ist in mehreren Parametergrößen erhältlich, darunter eine Version mit 1,3 Milliarden Parametern für Bilder und eine Version mit 14 Milliarden Parametern für die Videoerzeugung, mit kleineren Varianten, die für Verbraucherhardware optimiert sind.
Fähigkeiten und Anwendungsfälle
Wan 2.1 kann Videos mit einer Länge von bis zu 5 Sekunden bei 24 Bildern pro Sekunde erzeugen, mit Unterstützung für sowohl chinesische als auch englische Prompts. Es bietet auch eine Bild-zu-Video-Funktion, bei der ein statisches Bild gemäß einer Textbeschreibung animiert werden kann. Das Modell ist für Anwendungen in der kreativen Inhaltsproduktion, Werbung und Bildungsmedien konzipiert und wurde in die Model Studio-Plattform von Alibaba Cloud für den Unternehmenseinsatz integriert.
Zusätzlich zur Erzeugung umfasst Wan 2.1 eine Text-zu-Bild-Bearbeitungsfunktion, die es Benutzern ermöglicht, vorhandene Bilder basierend auf textuellen Anweisungen zu modifizieren. Das Modell unterstützt negative Prompts, um unerwünschte Elemente auszuschließen, und bietet Kontrolle über Kamerabewegung und Stil, was es für professionelle Videobearbeitungs-Workflows geeignet macht.
Veröffentlichung und Verfügbarkeit
Wan 2.1 wurde unter der Apache-2.0-Lizenz als Open Source veröffentlicht, wobei Modellgewichte und Inferenzcode auf Plattformen wie Hugging Face und GitHub bereitgestellt wurden. Die Veröffentlichung umfasste mehrere Varianten, wie Wan2.1-T2V-1.3B und Wan2.1-T2V-14B, die auf unterschiedliche Rechenbudgets zugeschnitten sind. Die Open-Source-Natur hat zu Community-Anpassungen geführt, einschließlich Quantisierungs- und Feintuning-Skripten, die eine Bereitstellung auf Verbraucher-GPUs mit reduzierten Speicheranforderungen ermöglichen.
Alibaba Cloud bietet das Modell auch als verwalteten Dienst mit API-Zugang für kommerzielle Benutzer an. Das Modell wurde in über 423 Prompts auf der wikiprompt-Plattform zitiert, was auf seine Beliebtheit bei KI-Enthusiasten und Forschern hinweist.
Leistung und Rezeption
Benchmark-Bewertungen zeigen, dass Wan 2.1 starke Leistungen bei Aufgaben wie der Text-zu-Video-Erzeugung erzielt, mit hohen Werten bei Metriken wie Bewegungsqualität und zeitlicher Konsistenz. Unabhängige Bewertungen loben seine Fähigkeit, komplexe Szenen zu verarbeiten, und seine mehrsprachige Unterstützung, obwohl einige Benutzer anmerken, dass es für die größeren Varianten erheblichen GPU-Speicher benötigt. Das Modell gilt als bedeutender Beitrag zur Open-Source-Videogenerierung, neben anderen Modellen wie OpenAIs Sora und Google DeepMinds Veo, wobei sich Wan 2.1 dadurch auszeichnet, dass es vollständig Open Source ist.
Siehe auch
- Alibaba Cloud
- Generative KI
- Diffusionsmodell
- Videogenerierung