Gemini 2.0は、Google DeepMindによって開発された大規模言語モデルのファミリーである。これはGemini 1.xシリーズの後継であり、マルチモーダルな理解と生成、およびエージェント型ワークフローの強化を目的としている。このモデルファミリーは公開LLMおよびメディアのリーダーボードに登場しており、2025年初頭時点のベンチマークスナップショットには5つのバリアントが記録されている。これらのバリアントは、推論、コーディング、数学、指示追従などのタスクで評価され、OpenAIやAnthropicのモデルとしばしば競合している。
Gemini 2.0はTransformerアーキテクチャに基づいており、マルチヘッドアテンションと混合専門家層の進歩を取り入れ、効率性とスケーラビリティを向上させている。モデルは深層学習技術を用いて訓練され、AIフィードバックからの強化学習やカリキュラム学習を含み、出力を人間の好みや複雑なタスク要件に合わせている。Google DeepMindはGemini 2.0を、リアルタイムのデータストリームやツール使用を処理できる、より自律的で対話的なAIシステムへの一歩として位置づけている。
アーキテクチャと訓練
Gemini 2.0ファミリーは、前モデルと同様のデコーダー専用Transformerアーキテクチャを採用しているが、位置エンコーディングと層正規化の最適化により、長いシーケンスでの訓練を安定させている。訓練データには、テキスト、画像、音声、ビデオの多様な組み合わせが含まれており、モデルが複数のモダリティを処理および生成できるようにしている。訓練パイプラインでは、Adamオプティマイザのバリアントと、ウォームアップとコサイン減衰を備えた学習率スケジュールを使用し、勾配クリッピングとともに発散を防いでいる。
計算需要に対応するため、Google DeepMindはGoogle Cloudインフラストラクチャ、特にTPU(テンソル処理ユニット)に依存している。これはニューラルネットワークワークロード向けに設計されたカスタムアクセラレータである。モデルは大規模に訓練され、パラメータ数はバリアントによって数十億から1兆を超える範囲に及ぶが、正確な数値はすべてのバージョンで公開されているわけではない。
機能とベンチマーク
Gemini 2.0のバリアントは、MMLU、HumanEval、MATHなどの標準ベンチマークに加え、SWE-benchやGAIAなどの新しいエージェント型ベンチマークで評価されている。公開リーダーボードでは、モデルは競争力のあるパフォーマンスを示しており、特に画像やビデオを推論できるマルチモーダルタスクで優れている。ベンチマークスナップショットの5つのバリアントは、おそらく異なるサイズや専門構成に対応しており、一般的な使用向けのプロモデルや低遅延アプリケーション向けのフラッシュモデルなどが含まれる。
静的ベンチマークに加えて、Gemini 2.0はリアルタイム対話向けに設計されており、ライブビデオ理解や音声対音声対話などの機能をサポートしている。これは、SearchやAssistantなどの製品にAIを統合するというGoogleの広範な戦略と一致しているが、具体的な製品統合は公開情報源では詳述されていない。
リリースと利用可能性
Gemini 2.0は2024年後半にGoogle DeepMindによって発表され、最初のモデルはGoogle CloudのVertex AIとGemini APIを通じて利用可能になった。このリリースは、GoogleのAI原則に沿った内部テストと安全性評価の期間を経て行われた。2025年初頭時点で、モデルは開発者とエンタープライズ顧客が利用でき、価格はトークン使用量に基づいている。一部のバリアントはオープンパネルやサードパーティプラットフォームを通じて利用可能かもしれないが、主要な配信チャネルはGoogleのエコシステムである。
前モデルおよび競合他社との比較
Gemini 1.5と比較して、Gemini 2.0は改善された推論とより長いコンテキスト処理を提供し、一部のバリアントでは最大100万トークンをサポートしている。これにより、書籍全体や長いコードベースを1回のパスで処理できる。競合他社に対して、Gemini 2.0はOpenAIのGPT-4oやAnthropicのClaude 3.5と競合し、ベンチマークごとにリードを交換することが多い。例えば、Gemini 2.0はマルチモーダル推論で優れるが、バリアントによっては特定のコーディングタスクで遅れを取る場合がある。
今後の方向性
Google DeepMindはGeminiファミリーの反復を続けており、ビデオやロボティクス向けの生成AIなどの分野向けのより専門的なモデルを計画している。同社はまた、安全性と整合性を重視し、責任ある展開を確保するためにモデルプルーニングや解釈可能性研究に投資している。2025年初頭時点で、Gemini 2.0は研究開発の活発な領域であり、年内に更新が予想されている。