Make-A-Video リリース (2022年)

英語からの翻訳

Metaは2022年9月29日、テキストから動画を合成する生成AIシステム「Make-A-Video」を公開した。これにより、ユーザーはテキストプロンプトから短い動画クリップを生成できるようになり、クリエイティブAIツールにおける重要な進歩を示した。

Make-A-Videoは、Metaが開発した生成的人工知能システムであり、テキスト記述を短い動画クリップに変換するものである。2022年9月29日に発表され、大手テクノロジー企業による初の公開デモンストレーションされたテキストから動画へのモデルの一つを代表し、テキストから画像への生成における先行する進歩を基盤としていた。このシステムは、深層学習ニューラルネットワークのアーキテクチャの組み合わせを用いて、768x768ピクセル解像度で最大5秒間の動画を生成し、拡張クリップ用に追加フレームを任意で提供した。

このリリースにより、Metaは、その年の初めに画像合成で画期的な進歩を遂げていた急速に拡大する生成的AIの分野に位置づけられた。大規模なペアのテキストと動画のデータセットを必要とした初期の動画生成試みとは異なり、Make-A-Videoは既存のテキストと画像のトレーニングデータと教師なし動画映像を活用し、高コストなラベル付き動画コーパスの必要性を減らした。このアプローチにより、モデルはラベルなし動画から動きのパターンを学習しつつ、テキストと画像のペアで視覚的意味論を基盤付けることができた。

技術的アーキテクチャ

このシステムは、テキストから画像へのベースモデル、時間的デコーダー、フレーム補間ネットワークの3つの主要コンポーネントで構成されていた。トランスフォーマーアーキテクチャに基づくテキストエンコーダーは、テキストプロンプトを潜在表現にマッピングした。Metaの以前のMake-A-Sceneモデルに類似した画像生成モジュールは、テキストに条件付けられた静止画像を生成した。次に時間的デコーダーがこれをフレームシーケンスに拡張し、もっともらしい動きのダイナミクスを予測することを学習した。最後に、フレーム補間ネットワークがフレームレートを上げて、より滑らかな動画出力を生成した。

Metaの研究者らは、公開ウェブデータから取得した1000万のテキストと画像のペアと500万のラベルなし動画のデータセットを用いてモデルをトレーニングした。トレーニングプロセスは2段階を伴った。まず、画像生成コンポーネントを静止画像で事前トレーニングし、次に時間的層を動画データで微調整するというものである。この階層的トレーニングスキームは、通常、大規模なペアデータセットを必要とするエンドツーエンドの動画トレーニングと比較して、計算コストを削減した。

機能と限界

Make-A-Videoは、「スーパーヒーローの衣装を着た犬」や「肖像画を描くテディベア」などの多様なプロンプトから動画を生成できた。また、ユーザーが静止画像を提供してモデルがそれを動かす画像から動画への生成や、既存クリップのスタイルや内容を変更する動画から動画への編集もサポートしていた。このシステムは、毎秒16フレームで約5秒間の動画を生成でき、補間ネットワークを使用してより長いシーケンスに拡張できた。

しかし、このモデルには顕著な限界があった。複数のオブジェクトを含む複雑なシーンでは苦労し、形状の変形や一貫性のない物理などのアーティファクトを生成することが多かった。動画内のテキストレンダリングは頻繁に文字化けし、システムは音声を生成できなかった。解像度は当時としては高かったものの、放送品質には及ばなかった。Metaはこれらの欠点を認め、この技術は洗練された製品ではなく研究デモンストレーションであると述べた。

広範な文脈と受け止め方

このリリースは、生成的モデルへの関心が急騰する中で行われた。2022年初めには、OpenAIがテキストから画像への生成用にDALL-E 2を発表し、Google DeepMindがImagenを実証していた。Make-A-Videoはこのパラダイムを時間的領域に拡張し、研究者や一般市民の注目を集めた。メディア報道は、創造的可能性と、誤解を招くまたは有害なコンテンツを生成する可能性を含む倫理的リスクの両方を強調した。

Metaはモデルを直ちに公開せず、代わりに選択されたユーザー向けに限定されたウェブデモを提供した。同社は、暴力的、性的、またはその他の不適切なコンテンツをブロックするフィルターなどの安全対策を実装した後にのみアクセスを許可すると述べた。この慎重な展開は、当時の業界慣行を反映しており、企業は生成的AIの二重使用の性質に取り組んでいた。

影響と遺産

Make-A-Videoのリリースは、テキストから動画への生成におけるさらなる研究を促進した。数ヶ月以内に、Alibaba Cloudやさまざまな学術研究所を含む他の組織が同様のシステムを発表した。時間的デコーダーとフレーム補間の使用などの基盤技術は、Meta自身のEmu VideoやRunwayのGen-2などのサードパーティシステムを含むその後のモデルに影響を与えた。テキストと画像のデータを活用して動画注釈コストを削減するという強調は、この分野の標準的な実践となった。

2024年までに、テキストから動画へのモデルは大幅に進歩し、音声付きでより長く高解像度のクリップを生成できるシステムが登場した。Make-A-Videoは、この軌跡における初期のマイルストーンとして認識されており、言語のみから一貫した動きを合成する可能性を実証した。そのアーキテクチャとトレーニング方法論は、一連の後続研究に情報を提供し、人工知能と創造的ツールの歴史におけるその地位を確固たるものにした。

安全性と倫理的考慮事項

Metaの発表には、潜在的な悪用に関する議論が含まれていた。同社は、モデルが偽情報や非同意コンテンツの作成に使用される可能性があると指摘し、責任あるAI開発へのコミットメントを強調した。これらのリスクを軽減するために、Metaは生成された動画に透かしを入れ、基盤モデルへのアクセスを制限する計画を立てた。同社はまた、生成的機能とともに成長する分野である合成メディアの検出方法に関する継続的な研究にコミットした。

批評家は、そのような保護措置は予防的ではなく反応的であり、生成的AI開発の急速なペースが規制枠組みを上回っていると指摘した。この議論は、後のモデルで激化したが、2022年の公共の言説にすでに存在していた。したがって、Make-A-Videoは技術的成果としてだけでなく、生成的AIによってもたらされる社会的課題のケーススタディとしても機能した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-video·meta·artificial-intelligence
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴