Wan 2.1は、生成的人工知能モデルであり、Alibaba Cloudによってテキスト記述から画像や動画を生成するために開発された。2025年にオープンソースモデルとして公開され、研究者や開発者が様々なアプリケーションにダウンロードして利用できるようになった。このモデルは、より広範なWanモデルファミリーの一部であり、画像生成と動画生成の両方のタスクを処理するように設計されており、中国語や英語を含む複数言語のテキストプロンプトをサポートしている。
このモデルは、深層学習アーキテクチャに基づいて構築されており、トランスフォーマーネットワークと拡散技術を活用している。高解像度の画像と短い動画クリップを生成でき、テキストから画像、テキストから動画、画像から動画への生成機能を含む。Wan 2.1は、その効率性と品質で注目されており、VBench動画生成評価スイートなどのベンチマークで競争力のある結果を達成している。
アーキテクチャとトレーニング
Wan 2.1は、U-Netベースの拡散バックボーンとマルチヘッドアテンション機構を組み合わせており、他の最新の動画生成モデルと類似している。このモデルは、テキストと視覚データのペアからなる大規模データセットでトレーニングされ、データ拡張やカリキュラム学習などの技術を用いて汎化性能を向上させている。可変のアスペクト比と解像度をサポートし、動画では480pから720p、画像では最大1080pの典型的な出力サイズを提供する。
トレーニングプロセスでは、Adam最適化と学習率スケジューリング、勾配クリッピングを使用して収束を安定させている。このモデルは、画像用の13億パラメータ版や動画生成用の140億パラメータ版を含む複数のパラメータサイズで提供され、コンシューマー向けハードウェア向けに最適化された小型バリアントもある。
機能とユースケース
Wan 2.1は、毎秒24フレームで最大5秒の動画を生成でき、中国語と英語の両方のプロンプトをサポートしている。また、静止画像をテキスト記述に従ってアニメーション化できる画像から動画への機能も提供する。このモデルは、クリエイティブなコンテンツ制作、広告、教育メディアなどのアプリケーション向けに設計されており、エンタープライズ向けにAlibaba CloudのModel Studioプラットフォームに統合されている。
生成に加えて、Wan 2.1にはテキストから画像への編集機能も含まれており、ユーザーはテキストによる指示に基づいて既存の画像を変更できる。このモデルは、不要な要素を除外するためのネガティブプロンプトをサポートし、カメラの動きやスタイルの制御も提供するため、プロフェッショナルな動画編集ワークフローに適している。
リリースと入手可能性
Wan 2.1はApache 2.0ライセンスの下でオープンソース化され、モデルウェイトと推論コードがHugging FaceやGitHubなどのプラットフォームで公開された。リリースには、Wan2.1-T2V-1.3BやWan2.1-T2V-14Bなど、様々な計算リソースに対応する複数のバリアントが含まれていた。オープンソースの性質により、量子化やファインチューニングスクリプトを含むコミュニティによる適応が進み、メモリ要件を削減したコンシューマー向けGPUでの展開が可能になった。
Alibaba Cloudはまた、このモデルをマネージドサービスとして提供し、商用ユーザー向けにAPIアクセスを提供している。このモデルは、wikipromptプラットフォームで423以上のプロンプトで引用されており、AI愛好家や研究者の間での人気を示している。
パフォーマンスと評価
ベンチマーク評価では、Wan 2.1はテキストから動画への生成タスクで強力なパフォーマンスを達成し、モーション品質や時間的一貫性などの指標で高いスコアを獲得している。独立したレビューでは、複雑なシーンを処理する能力と多言語サポートが賞賛されているが、一部のユーザーは、より大きなバリアントではかなりのGPUメモリが必要であると指摘している。このモデルは、OpenAIのSoraやGoogle DeepMindのVeoなどの他のモデルと並んで、オープンソース動画生成への重要な貢献と見なされているが、Wan 2.1は完全にオープンソースである点で差別化されている。