Genieは、Google DeepMindによって開発された生成人工知能モデルであり、単一のテキストプロンプト、スケッチ、または画像から、プレイ可能でインタラクティブな2Dビデオゲーム環境を作成できる。2024年2月に発表されたこのモデルは、生成AIにおいて、静的なコンテンツ生成を超えて、完全にインタラクティブでリアルタイムの仮想世界を生成するという大きな進歩を表している。Genieは完全に教師なしのビデオデータで訓練され、明示的な指示やラベル付きの例なしに、ゲーム環境のダイナミクスをモデル化することを学習する。
Genieという名前は、Generative Interactive Environmentsの頭字語であり、その核となる目的、つまりユーザーが即座に探索し対話できる環境を生成することを反映している。物理、ルール、キャラクターの挙動を明示的にプログラミングする必要がある従来のゲームエンジンとは異なり、Genieはこれらの要素を視覚データから暗黙的に学習する。このアプローチにより、現実的な風景から抽象的な漫画のようなシーンまで、幅広い視覚スタイルに一般化できる。
アーキテクチャと訓練
Genieは、多くの現代の大規模言語モデルで使用されているのと同じ基礎モデルタイプであるトランスフォーマーアーキテクチャに基づいている。ただし、その訓練データはテキストではなく、公開されている2Dプラットフォーマーゲームビデオの20万時間以上で構成されている。モデルは、ビデオトークナイザー、潜在アクションモデル、ダイナミクスモデルの3つの主要コンポーネントで訓練される。
ビデオトークナイザーは、ニューラルネットワークが画像パッチを処理する方法と同様に、生のビデオフレームを離散トークンに圧縮する。潜在アクションモデルは、訓練ビデオでプレイヤーが取ったアクションを推論し、人間のラベル付けなしに8つの可能なアクション(左、右、ジャンプ、停止など)のセットを発見する。次に、ダイナミクスモデルは、現在のフレームと推論されたアクションが与えられた場合に次のフレームを予測し、リアルタイムのインタラクションを可能にする。
この訓練プロセスは完全に教師なしであり、Genieがアクションやゲームルールの明示的なラベルを受け取ることは決してない。代わりに、視覚的な変化を潜在アクションと関連付けることを学習する。これは、推論時に新しい環境に適応することを可能にする技術である。モデルは、マルチヘッドアテンションを備えたシーケンス・ツー・シーケンスフレームワークを使用して、ビデオの時間的依存関係を処理する。
機能とインタラクション
Genieは、テキスト記述、手描きのスケッチ、またはフルカラー画像など、さまざまな入力からプレイ可能な環境を生成できる。例えば、ユーザーがキャラクターとプラットフォームの単純な線画を提供すると、Genieはキャラクターが移動、ジャンプ、障害物と対話できる完全なゲーム世界を生成する。モデルは160x256ピクセルの解像度で動作し、現在のハードウェアでは毎秒約1フレームの速度でフレームを生成する。これはリアルタイムより遅いが、コンセプトを実証するには十分である。
8つのアクションの潜在アクション空間は訓練データから学習され、生成された異なる環境間で一貫している。つまり、ユーザーが1つのGenie生成ゲームのコントロールを学習すると、モデルが作成する他の環境にも同じコントロールを適用できる。モデルはまた、ある程度の永続性を示し、複数のフレームにわたって環境の状態を維持する。これは一貫したゲームプレイに不可欠である。
他のAIモデルとの関係
Genieは、インタラクティブで具現化されたAIに向けた人工知能研究のより広いトレンドの一部である。OpenAIのGPTシリーズやAnthropicのClaudeのようなモデルがテキスト生成に焦点を当てている一方で、Genieは世界モデリング、つまり環境がアクションに応じて時間とともにどのように変化するかを理解するという課題に取り組んでいる。この能力は、物理的またはシミュレートされた世界で動作できるより一般的な機械学習システムへの足がかりと見なされている。
膨大なテキストコーパスに依存する大規模言語モデルとは異なり、Genieのビデオデータへの依存は、言葉で表現するのが難しい視覚的および物理的ダイナミクスを捉えることを可能にする。モデルの教師なし学習アプローチは、明示的な報酬信号を必要とするAIフィードバックからの強化学習のような方法とは対照的である。Genieの受動的観察から学習する能力は、カリキュラム学習やデータ拡張の研究と一致しているが、これらの技術を直接使用しているわけではない。
制限と将来の方向性
現在のバージョンのGenieにはいくつかの制限がある。出力解像度は低く、フレームレートは商業ゲームアプリケーションにはまだ適していない。モデルはまた、重力や衝突検出などの複雑な物理に苦労しており、生成された環境で一貫性のない挙動につながる可能性がある。さらに、プラットフォーマーゲームで訓練されているため、ファーストパーソンシューティングやパズルゲームなどの他のジャンルの生成にはあまり効果的ではない。
Google DeepMindは、将来のバージョンのGenieで、モデルをスケールアップし、高解像度の訓練データを組み込み、他のドメインからの深層学習技術を統合することで、これらの問題に対処することを示している。チームはまた、物理エージェントの訓練を加速できるインタラクティブ環境の生成能力が役立つ、ゲーム以外のロボティクスやシミュレーションなどのアプリケーションを探索する計画も立てている。2025年初頭の時点で、Genieは消費者向け製品ではなく研究デモのままであるが、その新しい世界生成アプローチでAIコミュニティにかなりの関心を引き起こしている。
影響と評価
Genieの発表は、研究者や技術者から熱意を持って迎えられ、インタラクティブAIの未来を垣間見るものと見なされた。生成モデルが静的な出力を生成するだけでなく、リアルタイムシミュレーションの領域に移行できることを実証した。モデルの教師なし学習パラダイムは、深層学習プロジェクトで一般的なボトルネックである高価な人間のアノテーションの必要性を減らす点で特に賞賛された。
Genieはまた、AI生成のインタラクティブコンテンツの倫理的影響、特に著作権と悪用の可能性についての疑問を提起した。モデルは公開されたビデオで訓練されており、その一部は著作権で保護されている可能性があるため、その出力の法的地位について継続的な議論がある。しかし、現時点では、Genieに関してGoogle DeepMindに対して主要な法的異議申し立ては行われていない。モデルはまた、スタンフォードAIラボやバークレーAIリサーチでの作業を含む、同様の世界モデリングアプローチを探索するインタラクティブ生成の他の研究努力にも影響を与えている。