CoDi(Composable Diffusionの略)は、生成的人工知能モデルであり、マイクロソフトリサーチによって開発されたもので、テキスト、画像、音声、動画という複数のモダリティを単一の統合フレームワークで処理および生成できる。データ型ごとに別々のモデルに依存していた初期のマルチモーダルシステムとは異なり、CoDiは構成可能な拡散アプローチを用いており、これらのモダリティの任意の組み合わせを同時に生成できる。例えば、単一のプロンプトから同期した音声とテキストキャプションを伴う動画を生成することが可能である。このモデルは2023年の研究論文で紹介され、より統合されたマルチモーダルAIシステムへの一歩を示している。
CoDiは、拡散モデルの成功に基づいている。拡散モデルは、ランダムノイズを反復的に洗練して構造化された出力を生成する機械学習アルゴリズムの一種である。その主要な革新は、複数のモダリティ固有の拡散プロセスを単一のモデルに組み合わせる能力にあり、トレーニング中にすべてのモダリティが存在することを必要とせずに、クロスモーダル生成を可能にする。これにより、すべてのモダリティにわたるペアデータを必要とした以前のアプローチよりも、システムは柔軟かつ効率的になる。
アーキテクチャと設計
CoDiのアーキテクチャは、いくつかの主要コンポーネントで構成されている。その中核には、異なるモダリティが連続ベクトルとして表現される共有潜在空間がある。各モダリティには独自のエンコーダとデコーダがあるが、これらは構成可能な拡散フレームワークを通じて接続されており、モデルが任意の組み合わせで出力を生成できるようにしている。モデルは、クロスモーダルな注意のためのTransformerベースのバックボーンを採用しており、テキスト、画像、音声、動画のドメインにわたって表現を整列させることができる。
注目すべき特徴は、トレーニング中の「ブリッジング」メカニズムの使用である。4つのモダリティすべてにわたるペアデータが不足しているため、CoDiは段階的にトレーニングされる。まず個々のモダリティペア(例:テキスト-画像、テキスト-音声)で、次にトリプレットで、最後にすべての組み合わせでトレーニングされる。この段階的トレーニングにより、完全なマルチモーダルデータセットが利用できない場合でも、モデルはクロスモーダルな関係を学習できる。
機能と応用
CoDiは、さまざまな生成タスクを実行できる。例えば、シーンを説明するテキストプロンプトが与えられると、同期した音声と一致するテキスト記述を備えた動画を生成できる。また、既存のコンテンツをモダリティ間で編集することもできる。例えば、画像のセマンティックコンテンツを保持しながらスタイルを変更したり、動画の視覚的なアクションに一致する効果音を生成したりすることが可能である。
モデルの構成可能な性質により、ユーザーは任意のモダリティのサブセットに生成を条件付けることができる。この柔軟性は、コンテンツ作成、アクセシビリティツール(例:画像の音声説明の生成)、インタラクティブメディア制作に潜在的な応用がある。研究者は、CoDiがモダリティ間で一貫性のある出力を生成でき、生成されたテキスト、ビジュアル、音声の間でセマンティックな一貫性を維持することを実証している。
トレーニングとデータ
CoDiは、LAION-5Bなどのソースからの画像-テキストペア、音声-テキストペア、動画-テキストデータセットを含む公開データセットでトレーニングされた。段階的トレーニングアプローチには、モデルがより複雑なマルチモーダルな組み合わせに進む前に、まずより単純なペアワイズな整列を学習するという、慎重なカリキュラム設計が必要であった。研究者は、対照学習と拡散目的関数の組み合わせを用いて、エンコーダとデコーダをトレーニングした。
トレーニングで対処された課題の1つは、モダリティ間でのデータ可用性の不均衡であった。テキストと画像のデータは豊富である一方、高品質の動画-音声-テキストのトリプレットはより稀である。CoDiの構成可能な設計は、モデルがペアワイズデータを活用して未見のモダリティの組み合わせに一般化できるようにすることで、これを緩和している。
評価と影響
CoDiは2023年のコンピュータビジョンおよびパターン認識会議(CVPR)で発表され、マルチモーダル生成への統合的アプローチで注目を集めた。これは、単一のフレームワークで4つの主要なコンテンツタイプすべての同時生成を実証した最初のモデルの1つであり、その後のマルチモーダル学習および基盤モデルに関する研究に影響を与えた。
CoDiは主に研究プロトタイプであり、商業製品としてリリースされなかったが、そのアイデアは、OpenAIやGoogle DeepMindによる取り組みを含む、その後の統合マルチモーダルモデルに関する研究に情報を提供している。モデルの構成可能性と段階的トレーニングへの重点は、効率的なマルチモーダルAIを探求する他の研究グループによってさまざまな形で採用されている。
制限事項
CoDiにはいくつかの制限がある。その出力解像度と品質、特に動画については、専門の単一モダリティモデルよりも低い。モデルは、長文コンテンツや拡張シーケンスにわたる一貫性の維持に苦労することがある。さらに、拡散に依存しているため、生成は計算集約的であり、かなりのGPUリソースを必要とする。段階的トレーニングアプローチは、稀なモダリティの組み合わせでのパフォーマンスが一般的なペアほど堅牢でない可能性があることも意味する。
倫理的考慮事項には、合成メディア生成における悪用の可能性が含まれる。他の生成モデルと同様に、ディープフェイクや誤情報に関する懸念があるが、CoDiの研究ステータスはその直接的な展開を制限している。
関連項目
参考文献
- Tang, Z., et al. (2023). CoDi: Composable Diffusion for Real-World Image and Video Generation. CVPR.
- Microsoft Researchのブログ記事およびCoDiに関する技術文書。