英語からの翻訳

Make-A-VideoはMetaのテキストから動画を生成するモデルであり、2022年に発表され、生成的AIと拡散技術を用いてテキストプロンプトを短く高品質なビデオクリップに変換する。

Make-A-Videoは、Metaが開発した生成AIシステムであり、テキスト記述から短い動画クリップを生成する。2022年9月に発表され、大規模テクノロジー企業による最初期の商用グレードのテキストから動画への生成モデルの一つとなった。これは、それ以前のテキストから画像への生成に関する研究に続くものである。このシステムは、深層学習およびニューラルネットワークアーキテクチャ、特に拡散モデルの進歩を活用し、自然言語のプロンプトから現実的な動きとシーンを合成する。

このモデルは、Metaによる画像生成に関する先行研究、特にMake-A-Sceneシステムに基づいており、それを時間的次元へと拡張したものである。テキストと動画のペアデータを必要とした初期の動画生成アプローチとは異なり、Make-A-Videoは主にラベルなしの動画データで訓練され、言語と視覚コンテンツの対応付けを画像とテキストのペアから学習した。これにより、大規模な動画キャプションデータセットを必要とせずに動画を生成できるため、実用的な大きな利点となった。

アーキテクチャと訓練

Make-A-Videoは3段階のパイプラインを使用する。第一に、トランスフォーマーアーキテクチャに基づくテキストエンコーダーが、入力プロンプトを意味的埋め込みに変換する。第二に、拡散モデルが一連の潜在フレームを生成し、空間的構成と時間的ダイナミクスの両方を捉える。第三に、デコーダーがこれらの潜在表現をフル解像度の動画フレームにアップスケーリングする。訓練プロセスは2つの段階で構成される。物体の外観とレイアウトを理解するための画像とテキストのペアによる空間モデルの訓練と、動きのパターンを学習するためのラベルなし動画による時間モデルの訓練である。この分離により、高価な動画とテキストのデータセットへの依存が軽減された。

このモデルは、公開されている大規模な画像および動画コーパスで訓練されたが、Metaは正確なデータセットの規模を開示しなかった。このシステムは、最大768×768ピクセルの解像度と、毎秒約16フレームのフレームレートで、約5秒の長さの動画を生成できた。また、ソース画像のバリエーション生成、2つの画像間のスムーズな遷移を補間する機能、静止画像のアニメーション化など、追加の機能もサポートしていた。

機能と限界

Make-A-Videoは、動物や物体から抽象的な概念まで、幅広いシーンを生成でき、一貫した動きとプロンプトへの合理的な忠実性を実現した。例えば、「テディベアが肖像画を描いている」といったプロンプトから、ブラシを動かすクマの短いクリップが生成された。しかし、このモデルには顕著な限界もあった。正確な反射や物体間の現実的な相互作用など、複雑な物理現象を苦手としており、形状の変形やテクスチャのちらつきといったアーティファクトを生成することがあった。動画内のテキストレンダリングも貧弱であり、音声を生成することはできなかった。これらの問題は、初期のテキストから動画へのシステム全般に共通するものであった。

モデルの出力品質はプロンプトの具体性に依存し、曖昧なプロンプトはしばしば一般的または反復的な動きを生成したが、詳細なプロンプトは忠実性を向上させた。Metaは、このシステムが研究デモンストレーションであり、完成された製品ではないと強調し、公開APIやオープンソースモデルとしてリリースされることはなかった。その代わりに、Metaは研究論文とサンプル動画付きのデモページを公開し、これが大きなメディアの注目を集めた。

同時代のシステムとの比較

Make-A-Videoは、競争の激しい環境の中で登場した。OpenAIは、それ以前に画像生成用のDALL-E 2をリリースしており、2022年にはImagen Videoと呼ばれる動画生成モデルも発表したが、これは公開展開されなかった。Google DeepMindは、テキストから動画を生成するPhenakiを実証しており、Alibaba CloudNVIDIAなどの他の研究所も同様の技術を模索していた。Make-A-Videoは、ラベルなし動画訓練の使用によるデータ要件の削減と、当時としては比較的高い視覚品質で際立っていた。しかし、最初のシステムではなく、清華大学と中国のテクノロジー企業BAAIによるCogVideoなどの初期システムが、2021年に基本的なテキストから動画への生成を示していた。

主な差別化要因は、Metaがユーザーフレンドリーな出力と画像ベースの事前知識の統合に焦点を当てたことであり、このモデルは単一の画像を入力としてアニメーション化できる点がレビュアーに印象を与えた。対照的に、多くの競合他社は複数の入力フレームやより長いプロンプトを必要とした。トレードオフとして、Make-A-Videoの動画は短く、カメラアングルや物体の動きに対する細かい制御が欠けていた。

評価と影響

Make-A-Videoに関するメディアの報道は概ね好意的であり、風変わりで一貫性のあるクリップを生成する能力が賞賛された。技術評論家は、これが人工知能研究を静止画像から動的コンテンツへとシフトさせることを示唆していると指摘した。このモデルはまた、ディープフェイクや誤情報の可能性など、倫理的な懸念も提起した。Metaはこれらのリスクを認識し、安全策が開発されるまでモデルを公開しないと述べた。同社は透かしやコンテンツの出所を追跡するツールについても議論したが、これらはMake-A-Video自体には実装されなかった。

研究コミュニティにおいて、Make-A-Videoはその後の動画拡散モデルの研究に影響を与えた。そのアーキテクチャは、Meta自身のEmu Videoや、ModelScopeのテキストから動画へのモデルなどのオープンソースプロジェクトを含む、後続のシステムに着想を与えた。この論文「Make-A-Video: Text-to-Video Generation without Text-Video Data」は、2023年のInternational Conference on Learning Representations(ICLR)で発表され、広く引用されている。

遺産と将来の方向性

Make-A-Videoは最終製品というよりは、むしろ重要な足掛かりであった。2023年までに、Metaはより高度な動画生成研究、特に時間的一貫性と解像度を改善したEmu Videoモデルへと移行した。テキストから動画への生成という広範な分野は急速に進歩し、RunwayのGen-2やGoogle DeepMindのLumiereなどのモデルが、より長く、より現実的な出力を提供するようになった。Make-A-Videoの遺産は、大規模なペアデータセットを必要とせずに、テキストから高品質な動画を生成することが実現可能であることを実証し、このコンセプトを研究者と一般市民の両方に広めたことにある。

このモデルはまた、クリエイティブツールの民主化に関する議論にも貢献した。公開リリースはされなかったものの、その公開デモは、生成AIが動画制作の障壁をどのように低減できるかを示した。2024年現在、テキストから動画へのモデルはより利用しやすくなっているが、Make-A-Videoは、機械学習に基づくメディア生成の進化における初期の重要なマイルストーンとして認識され続けている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-video·meta·diffusion-model
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴