英語からの翻訳

Wan 2.2は2025年にリリースされた生成AIモデルであり、プロンプトからテキスト、画像、動画を生成することができる。大手テクノロジー企業によって開発され、APIとオープンウェイトを通じて利用可能である。

Wan 2.2は2025年にリリースされた生成人工知能モデルであり、テキスト、画像、動画生成を含む複数のモダリティを処理するように設計されています。これは前身であるWan 2.1のアーキテクチャを基盤としており、創造的および商業的用途のための多用途ツールとして位置づけられています。このモデルは、AI業界で急速な進歩が見られる分野である高品質な動画コンテンツを生成する能力で注目されています。

このモデルは、Deep learningおよびNeural networkアーキテクチャを活用するより広範なGenerative AIシステム群の一部です。Wan 2.2は、現代のAIモデルで標準となっているTransformer (architecture)ベースの設計を使用しています。これは自然言語プロンプトを含むさまざまな入力形式をサポートしており、出力は解像度や長さなどのパラメータを通じてカスタマイズできますが、これらの制御の詳細はベンダーによって完全には開示されていません。

リリースと入手可能性

Wan 2.2は、2024年末にデビューしたWan 2.1の成功に続き、2025年初頭に正式にリリースされました。このリリースには、クラウドおよびAIサービスで知られる大手テクノロジー企業である開発者からの公開発表が伴いました。このモデルは、同社のクラウドプラットフォーム上のAPIを通じてアクセス可能であり、オープンソースの重みを介しても利用できるため、開発者や研究者が自社のシステムに統合できます。

オープンウェイトのリリースにより、Wan 2.2はMachine learningコミュニティにとって特に魅力的なものとなり、専門的なデータセットでの微調整が可能になりました。開発者のドキュメントによると、このモデルは複数のパラメータサイズで提供されており、最大バージョンは300億以上のパラメータを持ちますが、正確な数値は独立して検証されていません。

機能とパフォーマンス

Wan 2.2はテキストから動画への生成に優れており、720p解像度で最大10秒のクリップを生成できます。また、テキストプロンプトから画像を生成したり、静止画像から動画を作成したりすることもでき、これは画像から動画への機能として知られています。開発者が報告したベンチマークテストでは、このモデルは標準的な動画生成メトリクスで競争力のあるスコアを達成しましたが、2025年初頭時点で第三者による評価は公開されていません。

テキスト生成に関しては、Wan 2.2はLarge language modelとして機能し、要約、翻訳、コード作成などのタスクを実行できます。このマルチモーダルな能力は、単一のモダリティに焦点を当てた初期のモデルとは一線を画しています。このモデルは、テキストプロンプトと視覚出力を整合させるためにCross-Attentionなどの技術を使用し、生成されたコンテンツがユーザーの意図と密接に一致することを保証します。

Wan 2.2のトレーニングプロセスには、バイアスを回避するためにキュレーションされた大規模なテキスト、画像、動画のデータセットが関与しました。開発者は、有害なコンテンツの生成を防ぐために安全フィルタがモデルに統合されていると述べていますが、独立した監査は実施されていません。

技術アーキテクチャ

Wan 2.2は、視覚コンポーネントにResidual Network (ResNet)およびU-Netアーキテクチャの修正版を基盤としており、言語コンポーネントはTransformer (architecture)エンコーダー・デコーダー構造に依存しています。このモデルは、テキストと視覚データの両方における複雑な依存関係を処理するためにMulti-Head Attentionメカニズムを組み込んでいます。トレーニングを安定させるためにBatch NormalizationおよびLayer Normalizationを使用し、効率的な収束のためにAdam (Optimizer)Learning Rate Schedulingを使用しています。

トレーニング中には一般化を向上させるためにデータ拡張技術が採用されており、モデルは制御されたテキスト生成のためにTop-K SamplingおよびTop-P (Nucleus) Samplingをサポートしています。動画生成パイプラインはカスケード方式を採用しており、最初に低解像度のフレームを作成してからアップスケーリングすることで、効率と出力品質が向上します。

アプリケーションとエコシステム

Wan 2.2は、開発者が提供する動画編集スイートやデザインアシスタントを含むいくつかのクリエイティブツールに統合されています。また、特別なライセンスを通じて学術研究にも利用可能であり、このモデルはマルチモーダル学習に関する研究で使用されています。開発者のクラウドプラットフォームは、Wan 2.2を実行するための事前設定された環境を提供し、主要なハードウェアベンダーからのGPUアクセラレーションをサポートしています。

開発者は、同期および非同期の両方のリクエストをサポートするシンプルなAPIを介してモデルにアクセスできます。ドキュメントにはPythonとJavaScriptの例が含まれており、トラブルシューティング用のコミュニティフォーラムもあります。オープンウェイトにより、建築ビジュアライゼーションやアニメーションコンテンツなどのニッチな分野に特化したコミュニティ構築のバリアントも生まれています。

評価と影響

Wan 2.2の初期の評価は肯定的であり、開発者はその出力品質と使いやすさを賞賛しています。テックブログは、OpenAIGoogle DeepMindなどの企業の他の著名なモデルと競合していると指摘していますが、評価基準が異なるため直接的な比較は限られています。このモデルのオープンウェイトな性質は、Artificial intelligence分野のトレンドに沿った、高度なAIへのアクセスを民主化する動きと見なされています。

2025年半ばの時点で、Wan 2.2に関する大きな論争は報告されていません。開発者は定期的なアップデートを約束しており、後継機であるWan 3.0が開発中であるとの噂がありますが、公式な発表は行われていません。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·multimodal-model·video-generation·large-language-model
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴