Wanは、阿里巴巴(アリババ)のTongyi Wanxiang研究所によって開発された、動画生成モデルのオープンウェイトファミリーです。最初のオープンリリースであるWan 2.1は2025年2月に登場し、寛容なライセンスの下でモデルウェイトがHugging Faceに公開され、すぐにオープンウェイト動画モデルの基準となり、AI動画において2022年の画像生成におけるStable Diffusionに匹敵する役割を果たしました。
Wan 2.1
Wan 2.1は、品質重視の14Bパラメータモデルと、約8GBのVRAMを搭載したコンシューマー向けGPUで動作する1.3Bパラメータのバリアントの、主に2つのサイズで提供されました。どちらも480pおよび720pでのテキストから動画および画像から動画の生成をサポートし、時空間圧縮のための3D因果変分オートエンコーダーを備えた拡散トランスフォーマーアーキテクチャに基づいています。リリース時点で、Wan 2.1はオープンモデルの中でVBenchリーダーボードのトップに立ち、いくつかのクローズドシステムと競合する性能を示しました。
その後のリリース
2025年7月にリリースされたWan 2.2は、混合エキスパート設計に移行し、動きの品質と、照明や構図のためのシネマティック制御ボキャブラリーを改善しました。このファミリーは、Kling(快手)やSeedance(バイトダンス)などの他の中国製動画モデルと並んで、2025年から2026年にかけての急速なリリースの波に位置し、オープン/クローズドの両側で動画ベンチマークを前進させました。
エコシステムと評価
ウェイトがオープンであるため、Wanは数週間以内にローカル生成エコシステムに組み込まれました。ComfyUIワークフロー、LoRAファインチューン、量子化ビルド、コンシューマー向けフロントエンドとの統合などです。Stable Diffusionを中心に形成されたコミュニティは、Wanを動画エンジンとして採用し、オープンな評価データセット(Rapidataの人間選好研究など)は、その出力が自然シーン、雰囲気のあるショット、単一被写体の動きにおいて商用システムに近い評価を受け、複雑な多被写体の振り付けや読みやすいテキストでは性能が弱いことを示しています。
Wanのリリースは、オープン対クローズドの議論において、フロンティアに近い動画能力が長くプロプライエタリな状態に留まらない証拠として頻繁に引用されます。その結果は、LMArenaや他のアリーナが追跡する動画リーダーボードに登場し、Wanモデルは定期的に最強のオープン出場者としてランク付けされています。