Veo 2は、Google DeepMindによって開発されたGenerative AIビデオモデルである。2024年12月16日に一般公開され、テキストプロンプトから動画を生成する。これは、同年のGoogle I/Oで発表された前身モデルVeoの基盤を発展させたものである。このモデルは、最大4K(4096x2304ピクセル)の解像度で動画を生成し、最大8秒の長さをサポートし、特定のツールでは延長クリップのオプションも備えている。
このモデルは、Deep learning技術を活用したMachine learningアーキテクチャ、具体的にはTransformer (architecture)ベースのフレームワークで動作する。テキスト入力をトークナイザーで処理し、時間的拡散プロセスを用いてフレームを合成し、その後U-Netベースの精細化ネットワークでアップスケーリングする。この2段階アプローチ(まず潜在的なビデオ表現を生成し、次にフル解像度に高める)により、Veo 2は複雑なシーンを一貫した動き、照明、物理で処理できる。
機能
Veo 2は自然言語理解に優れ、詳細なプロンプトを視覚的に一貫した映像に変換する。パン、ズーム、チルトなどのカメラ操作や、浅い被写界深度や広角ショットなどの異なるレンズタイプの模倣といった映画的な効果を処理できる。また、合成ビデオ用の音声生成もサポートし、同期した効果音や環境ノイズを生成する。これは、ビデオとオーディオの統合生成パイプラインを介して統合された機能である。
公開ベンチマークでは、Veo 2は92%の精度を達成した。最終的に、この数値はプロンプトへの忠実性と時間的一貫性を測定する内部テストでの性能を反映しており、人間の評価者による並行評価で、OpenAIのSoraやAnthropic支援ツールなどの競合モデルを上回った。
リリースと利用可能性
Veo 2は、Google Cloud Vertex AIプラットフォームを通じて導入され、エンタープライズユーザーはAPIを介してアクセスできるようになった。また、Googleのコンシューマー製品、例えばGoogle VideoFXツールや、YouTubeのShorts向けDream Screenなどの実験的機能でも利用可能になった。このモデルは、アクセスが制限されていた初代Veoの後継として位置づけられ、その展開には、AI生成コンテンツをマークするためのGoogle DeepMindのSynthID技術による透かしが伴っていた。
2024年12月のリリース日により、Veo 2は、2024年後半に発表されたRunwayのGen-3やOpenAIのSora Turboなど、他のビデオ生成ツールとの競争環境に置かれた。Google DeepMindは安全性対策を強調し、Reinforcement Learning from AI Feedback (RLAIF)(人工フィードバックからの強化学習)を実装して、出力を意図したプロンプトに合わせ、有害なコンテンツを減らした。
技術仕様
入力処理には、Large language modelシステムと同様にテキストを潜在空間にマッピングするトークナイザーが使用され、Google DeepMindのMulti-Head Attentionに関する研究に基づいている。生成は360p解像度のベースフレームから始まり、超解像ネットワークを介して反復的に精緻化され、最終出力にアップスケーリングされる。モデルのトレーニングには、ライセンスされたビデオ映像の1万時間以上からなるデータセットが使用されたが、正確な詳細は企業秘密の下で非公開のままである。
推論時間はハードウェアによって異なる。単一のNVIDIA A100 GPUでは、5秒の1080pクリップを約21分で生成できるが、Google CloudのTPU v5eクラスターにデプロイすると2分未満に短縮される。モデルのパラメータ数は、特許出願と技術白書に基づいて約150億と推定されているが、Google DeepMindはこの数値を公式に確認していない。
制限事項
進歩にもかかわらず、Veo 2は特定のタスクで苦戦する。生成されたビデオは、特に低照度シーンで、歪んだ指や不自然な目の動きなど、人間のシルエットに視覚的アーティファクトを示すことがある。フレーム内のテキストレンダリング(標識や字幕など)は、非ラテン文字スクリプトでしばしば乱れた出力を生成する。また、モデルには固定生成長が8秒あり、より長いリクエストでは複数のクリップを継ぎ合わせる必要があり、照明の不連続性を引き起こす可能性がある。
物理シミュレーションは改善されているが完璧ではなく、複雑な相互作用でオブジェクトが表面を貫通したり、誤った重力で落下したりすることがある。内部テストでの人間の判断では、Veo 2のサンプルの38%が「本物と区別できない」と評価され、写真のようなリアリズムの50%のしきい値を下回った。
倫理的および法的文脈
Veo 2の展開は、Deep learningの悪用に関する懸念を引き起こし、Googleは当初、承認されたパートナーへのアクセスを制限した。欧州連合では、AI法、特に透明性要件への準拠により、モデルの展開が遅れた。Carnegie Mellon UniversityやMIT CSAILグループを含む学術研究者は、その検出脆弱性を研究し、SynthID透かしが圧縮後も持続するが、敵対的編集で除去できることを発見した。
一部の競合他社とは異なり、Veo 2はD-Waveや量子コンピューティング要素を組み込んでおらず、古典的なNeural networkアクセラレーションのみに依存している。モデルのアーキテクチャは、RunwayのGen-2などのオープンソースプロジェクトと設計原則を共有しているが、フレームごとのリアリズムよりも時間的一貫性を優先する独自のトレーニング目的を採用している。
評価と将来
業界アナリストは、Veo 2をGoogle DeepMindにとって重要な一歩と指摘し、同ラボを実世界のビデオ合成のリーダーとして位置づけた。Waymoの競合他社のシミュレーションなど、映画制作の初期採用者は、公開結果を出さずにトレーニングシナリオ作成のテストを行っている。2025年初頭の時点で、Google DeepMindはモデルの反復を続けており、より長い時間とインタラクティブ編集を備えたVeo 3の噂があるが、公式発表はまだない。