Gatoは、Google DeepMindによって開発され、2022年に初めて発表された汎用人工知能システムである。これは、テキスト生成、画像認識、ロボット制御、ゲームプレイにわたる604の異なるタスクを実行するために訓練された単一のニューラルネットワークである。Gatoの設計は、Transformer (architecture)アーキテクチャに基づいており、大規模言語モデルで使用されるのと同じ基盤であるが、それをテキスト、画像、連続制御信号を含むマルチモーダル入力と出力を処理するよう拡張している。
このシステムは、タスク固有の微調整なしで単一のモデルが幅広い領域にわたって有能な性能を達成できることを実証するものとして紹介された。すべてのタスクで専門システムを上回るわけではないものの、GatoはAI研究におけるジェネラリストエージェントの可能性を強調し、より柔軟で適応性のあるモデルへの広範な取り組みと一致したものである。
アーキテクチャと訓練
Gatoのアーキテクチャは、さまざまなモダリティからのトークンを処理する変換器ベースのシーケンスモデルである。画像などの入力は視覚エンコーダを介して渡され、テキストと離散的なアクションは直接トークン化される。ロボットの関節トルクなどの連続制御出力はビンに離散化される。モデルは全てのタスクタイプにわたって、シーケンス内の次のトークンを予測するという標準的な機械学習目的でトレーニングされる。
学習データは、テキストコーパス、画像データセット、ゲームプレイ録画、実世界のロボット操作のデモンストレーションなど、さまざまなソースからのものであった。このモデルは約12億個のパラメータを持ち、同時代の大規模言語モデルと比較して比較的小規模である。学習は単一のTPUv3ポッドを使用して行われ、データと計算の効率を反映している。
能力とタスク
Gatoは、以下を含むカテゴリにわたって604のタスクで評価された。
- テキストタスク: 質問応答、要約、対話生成。
- 視覚タスク: 画像キャプションとオブジェクト認識。
- ゲームプレイ: アタリゲームとチェス環境でアマチュアレベルの性能を達成。
- ロボティクス: 実地のロボットアームを制御してブロックを積み重ね、オブジェクトを操作。
モデルは正転移を示し、つまり一部のタスクセットでのトレーニングが他での性能を向上させた。例えば、テキストと画像データへの曝露がロボット制御タスクに役立ち、モダリティー間の共有表現が有益であることを示唆している。
意義と受容
Gatoは、その深さよりも幅広さで注目を集めた。それはほとんどのタスクで専門家のパフォーマンスの50%かそれ以上を達成し、専門家が汎用能力を測定するために使用した基準である。このシステムは人工知能全般に向けた一歩と見なされたが、専門家は専用モデルの深い特化が欠けていると指摘した。
批判者は、Gatoの個々のタスクでのパフォーマンスは、しばしば最先端のシステム未満であり、'専門家'という概念は固定のタスクセットに限定されていると指摘した。それでも、Gatoは生成AIやマルチタスク学習のその後の研究に影響を与え、特にDeepMindと広いAIコミュニティ内で影響を及ぼした。
他のモデルとの関係
Gatoは、大規模言語モデルなどの、OpenAIやAnthropicからのモデルと同じ概念的根源を共有しているが、制御とマルチモーダル統合に焦点を明確に置いている点で異なる。純粋なテキストモデルとは異なり、Gatoは物理的・疑似環境とやり取りすることができ、身体を持つAIシステムに近い存在である。また、異なるタスクを単一のアーキテクチャに統合する取り組みであり、これが後続のモデルで続くトレンドと並行している。
遺産と今後の方向
ガトーの公開は、専門家エージェントのスケーラブル化に関する議論を引き起こした。その後のこの分野の研究では、より大きなモデル、より多様なタスクセット、改良されたトレーニング技術を模索している。Gato自体が商業的に製品化されたわけではないが、その原理は後のDeepMindプロジェクトに影響を与え、複数のモダリティを処理する基礎モデルへの総的な変化に貢献した。
2025年の時点で、単一のモデルが数百のタスクを実行するという概念は依然として活発な研究領域であり、Gは初期の概念実証としての役割を果たしている。その遺産は、統合されたアーキテクチャだけで多様な領域で合理的な性能を達成できることを示し、より優れた専門家モデルの可能性を開拓することにある。