Imagen Videoリリース(2022年)

英語からの翻訳

Imagen Videoリリース(2022年)は、Googleのテキストから動画を生成するモデルを指し、2022年10月に発表され、同社のImagenテキストから画像を生成する技術に基づいています。これは、ベースの拡散モデルとアップサンプリングを使用して、テキストプロンプトから短く高品質な動画を生成します。

Imagen Videoは、Googleによって開発されたテキストから動画を生成する生成モデルであり、2022年10月に初めて発表されました。これは、Googleの初期のImagenテキストから画像を生成するシステムの機能を拡張し、自然言語の記述から短く、忠実度の高い動画クリップを生成するものです。このモデルは、Generative AIにおける重要な一歩を表しており、拡散ベースの技術を静止画像だけでなく、動画の時間的次元にも適用しています。

この発表では、Imagen Videoは消費者向け製品ではなく研究デモンストレーションとして位置づけられ、Googleは創造的な応用の可能性を強調する一方で、悪用のリスクも認めていました。これは、Google DeepMindのチームによって開発されましたが、当時は2023年4月にDeepMindと合併する前のGoogle Brainの一部でした。

技術的アーキテクチャ

Imagen Videoは、元のImagen画像モデルで使用されたカスケード拡散モデルアプローチに基づいています。このシステムはいくつかの段階で動作します:基本となる動画拡散モデルが、64x64ピクセルのフレームサイズから始めて、毎秒24フレームの低解像度動画を生成します。これに続いて、一連の空間的および時間的アップサンプラーが解像度を1280x768ピクセルまで増加させます。

このモデルは、凍結されたTransformer (architecture)ベースのテキストエンコーダー、具体的にはT5を使用して、入力プロンプトを解釈します。このテキストエンコーディングは、その後、拡散プロセスに供給され、ランダムノイズを反復的にノイズ除去して一貫性のある動画フレームを生成します。初期のいくつかの動画生成の試みとは異なり、Imagen Videoは動画自体の生成にLarge language modelに依存せず、言語モデルをテキスト理解のみに使用します。

主要な革新には、フレーム間の滑らかな動きを保証する時間的スーパーレゾリューションネットワークと、詳細を追加する空間的スーパーレゾリューションネットワークの使用が含まれます。このモデルは、公開されているLAION-5Bデータセットからの動画とGoogle内部データを含む、1400万の動画とテキストのペアのデータセットでトレーニングされました。

能力と限界

Imagen Videoは、毎秒24フレームで最大5秒の長さの動画を生成でき、映画的、3Dアニメーション、水彩画などのさまざまなスタイルをカバーしています。また、動画内にテキストを生成することもできますが、画像モデルと同様の限界があります。このシステムは、16:9、9:16、1:1などのさまざまなアスペクト比をサポートしています。

デモンストレーションでは、このモデルは物体をアニメーション化し、単純なナラティブを作成し、テディベアが歩くシーンや宇宙船が着陸するシーンなどの複雑なシーンをレンダリングする能力を示しました。しかし、より長いシーケンス、複雑な物理、フレーム間での一貫性のあるキャラクターアイデンティティには苦労しました。また、このモデルは人間の手や顔を正確にレンダリングすることにも困難を抱えており、これはDeep learning生成モデルにおける一般的な問題です。

Googleは、このモデルがストーリーボード作成、アニメーションのプリビジュアライゼーション、教育コンテンツに使用できる可能性があると述べましたが、安全性の懸念から公開リリースはされませんでした。同社は、ディープフェイクや偽情報を含む、誤解を招くまたは有害なコンテンツを生成するリスクを強調しました。

同時代のモデルとの比較

Imagen Videoは、2022年9月に数週間早く発表されたMetaのMake-A-Videoを含む、当時の他のテキストから動画へのモデルと同時に発表されました。両方のシステムは同様の拡散ベースのアプローチを使用しましたが、Imagen Videoはより高い解像度と時間的一貫性を強調しました。

OpenAIのDALL-EやStability AIのStable Diffusionが画像に焦点を当てていたのとは異なり、Imagen Videoは大規模での動画生成に取り組んだ最初のものの一つでした。また、後のモデル、例えばSora(2024年にOpenAIによってリリース)とは、より短いクリップをより低い解像度で生成する点で異なりましたが、この分野のその後の研究の基礎を築きました。

このモデルのアーキテクチャは、同様のカスケード拡散技術を組み込んだImagen 2やImagen 3画像モデルを含む、後のGoogle製品に影響を与えました。Imagen Video自体は商業化されませんでしたが、その技術は2024年に発表されたVeoなど、Googleの後の動画生成の取り組みに情報を提供しました。

評価と影響

Imagen Videoへの初期の評価は肯定的であり、研究者たちは以前の研究と比較して生成されたクリップの品質を賞賛しました。テックジャーナリストは、動画が短く時には不完全であったものの、Machine learningによる動画合成の急速な進歩を示していると指摘しました。このモデルは、創造的なワークフローを加速できる可能性のある概念実証と見なされました。

しかし、一部の批評家は、このモデルがかなりの計算リソースを必要とし、ほとんどの研究者がアクセスできないものにしていると指摘しました。Googleはモデルの重みやAPIをリリースせず、独立した評価を制限しました。これは、より広範なコミュニティ実験を可能にしたStable Diffusionのようなオープンソースの取り組みとは対照的でした。

この発表はまた、テキストから動画への技術の倫理的影響についての議論を引き起こしました。学者や政策立案者は悪用に対する保護措置を求め、Googleがモデルを内部に留める決定につながりました。これは、後の生成動画モデルがしばしば同様の監視に直面した前例を設定しました。

遺産

2022年のImagen Videoのリリースは、Artificial intelligence研究におけるマイルストーンを示し、拡散モデルが画像から動画に拡張できることを実証しました。そのカスケードアーキテクチャとT5テキストエンコーディングの使用は、後のシステムで標準となりました。このモデルの限界、特に時間的一貫性と計算コストは、その後の研究の方向性を導きました。

2025年までに、動画生成モデルは大幅に進歩し、Veo 3やSoraのようなシステムが、ほぼ写真的品質で分単位のクリップを生成していました。Imagen Videoは、これらの発展への初期の前駆者としてしばしば引用され、テキストから動画への合成の実現可能性を示し、残る課題を浮き彫りにしました。

GoogleはImagenファミリーの開発を継続し、2023年12月にImagen 2、2024年8月にImagen 3、2025年5月にImagen 4をリリースしました。これらは画像に焦点を当てていましたが、2022年に開拓された動画機能は、Google CloudサービスやGeminiアシスタントを含むGoogleのより広範な生成AI製品に統合されました。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-video·google·diffusion-models
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴