Gemini 3は、Google DeepMindによって開発されたマルチモーダル大規模言語モデルであり、2025年11月にGemini 2.0の後継としてリリースされた。このリリースは、ツール使用と関数呼び出し機能の大幅な強化に焦点を当てており、モデルが外部ソフトウェアシステム、API、データベースと以前のバージョンよりも確実に対話できるようにした。Gemini 3は、モデルがデジタル環境全体でマルチステップタスクを自律的に実行できるエージェント型人工知能への大きな一歩として位置づけられた。
モデルファミリーは、以前のGeminiリリースで確立された命名規則を維持し、さまざまなユースケースに最適化されたバリアントを含んでいた。Google DeepMindは、Gemini 3のツールオーケストレーションの改善が、会話型AIと実用的な自動化の間のギャップを埋めるように設計されており、ソフトウェア開発、データ分析、エンタープライズワークフローでのアプリケーションを可能にすると強調した。
開発背景
Gemini 3の開発は、2023年12月6日にLaMDAとPaLM 2の後継として発表された元のGeminiモデルの基礎作業に基づいていた。最初のGemini 1.0リリースでは、Ultra、Pro、Nanoの3つのティアが導入され、Gemini ProがBardチャットボットを強化し、Gemini NanoがPixel 8 Proスマートフォンでオンデバイス実行された。このアーキテクチャは、2023年4月にGoogle DeepMindとして統合されたGoogle BrainとDeepMindの合併を通じて開発された。
その後のアップデートにより、Gemini 3への軌道が確立された。2024年2月、Gemini 1.5は、混合専門家アプローチと100万トークンのコンテキストウィンドウを導入し、元のモデルから大幅に拡張された。Gemini 2.0 Flash Experimentalは2024年12月11日に登場し、リアルタイムの音声とビデオ対話のためのマルチモーダルライブAPI、ネイティブ画像生成、統合されたGoogle検索を追加した。これらの機能は、Gemini 3の中心となるより洗練されたツール使用機能の基盤を築いた。
開発期間中、Google DeepMindは、CEOのDemis Hassabisによって明らかにされたように、Geminiをロボット工学と組み合わせて物理的に世界と対話する方法を模索した。この研究の方向性は、Gemini 3の関数呼び出しフレームワークの背後にあるエージェント型設計哲学に情報を提供した。
ツール使用アーキテクチャ
Gemini 3は、再設計されたツール使用アーキテクチャを導入し、モデルが複数の同時関数呼び出しを改善された精度とエラー回復で管理できるようにした。このシステムは、ユーザーの意図を解析し、適切なツールを選択し、JSONなどの機械可読形式で出力をフォーマットするための構造化されたアプローチを採用した。これは、マルチステップのツールシーケンスでしばしば苦労した以前のモデルからの脱却を表していた。
強化された関数呼び出しは、同期と非同期の両方の実行パターンをサポートし、開発者がGemini 3を複雑なバックエンドシステムに統合できるようにした。モデルは、ある関数の出力が別の関数への入力として機能するネストされたツール呼び出しを、コンテキストを失うことなく処理できた。Google DeepMindは、Gemini 3がGemini 2.0と比較してツール選択エラーを大幅に削減したと報告したが、特定のベンチマーク数値は発売時に完全には開示されなかった。
注目すべき機能は、モデルがサンドボックス環境内でコードスニペットを生成して実行し、ユーザーに提示する前に自身の出力をテストできることだった。この自己検証ループは、プログラミングタスクとデータ処理ワークフローでの信頼性を向上させた。
関数呼び出し機能
Gemini 3の関数呼び出し機能は、単純なAPI呼び出しを超えて、動的スキーマ発見を含むように拡張され、モデルが利用可能なエンドポイントを照会し、それに応じて呼び出しを適応させることができた。これは、内部APIが頻繁に変更されるエンタープライズ展開で特に有用だった。モデルは並列関数呼び出しをサポートし、複数のソースから同時にデータを取得して結果を合成できた。
開発者向けに、Googleはカスタムツールを定義するプロセスを簡素化する更新されたSDKとドキュメントを提供した。モデルは、型付きパラメータ、オプション引数、複雑な戻り値構造を処理できた。エラー処理は、ユーザーの介入なしにGemini 3が不正な呼び出しを修正できる再試行メカニズムを通じて改善された。
ツール使用フレームワークは、Google Cloudサービスとサードパーティプラットフォームの両方で動作するように設計された。Google Cloudとの統合により、ストレージ、データベース、機械学習サービスへのシームレスなアクセスが可能になり、Amazon Web ServicesとMicrosoft Azureのサポートにより、クロスクラウド展開が可能になった。この相互運用性は、マルチクラウド戦略を持つエンタープライズにとって重要なセールスポイントだった。
エージェント型AI統合
Gemini 3は、エージェント型AIにおける大きな進歩を表し、単純な質問応答を超えて自律的なタスク実行に移行した。モデルは複数の対話にわたって永続的な状態を維持でき、長期プロジェクトの進捗を追跡できた。これは、改善されたメモリ管理と明示的な状態追跡メカニズムの組み合わせを通じて達成された。
実際には、Gemini 3は、人間の監督なしに会議を予約し、メールのやり取りを管理し、顧客関係管理システムを更新する仮想アシスタントとして展開できた。ソフトウェア開発では、自然言語の指示に基づいてプルリクエストを作成し、テストを実行し、バグを修正できた。これらの機能により、Gemini 3はOpenAIとAnthropicによって開発されている同様のエージェント型機能の直接の競合相手として位置づけられた。
Google DeepMindは、エージェント型展開における安全性を強調し、金融取引やデータ削除などの影響の大きいアクションには人間の承認を必要とするガードレールを実装した。モデルには、すべてのツール呼び出しを追跡する監査ログも含まれており、コンプライアンス目的の透明性を提供した。
パフォーマンスとベンチマーク
発売時に、Google DeepMindは、Gemini 3がいくつかの標準評価で前任者を上回ることを示すベンチマーク結果をリリースした。モデルは、ToolBenchやAPI-Bankデータセットを含むツール使用ベンチマークで特に強みを示し、最先端の結果を達成した。Massive Multitask Language Understanding(MMLU)テストでは、Gemini 3は、90%のスコアで人間の専門家のパフォーマンスを初めて超えたモデルであるGemini Ultraによって確立された傾向を継続した。
Stanford AI LabやBAIR (Berkeley AI Research)などの学術機関からの独立した評価は、マルチステップ推論タスクでのモデルの改善された信頼性を確認した。ただし、一部の研究者は、Gemini 3が曖昧なツール仕様で依然として苦労し、最適なパフォーマンスのために慎重に作成されたプロンプトを必要とすることに注意した。モデルの実際のエンタープライズワークフローでのパフォーマンスは強いと報告されたが、長期実行のエージェント型セッションでは時折人間の介入が必要だった。
エンタープライズと開発者アクセス
Gemini 3は、Gemini API、Google Cloud Vertex AI、AI Studioを含む複数のチャネルを通じて利用可能になった。Googleは、使用量に基づく段階的な価格設定を提供し、実験用の無料ティアと本番ワークロード用の有料プランを用意した。モデルは100か国以上でアクセス可能で、複数の言語をサポートしていたが、英語が最も完全に最適化されたままであった。
エンタープライズ顧客向けに、Googleは専用インフラストラクチャ、新機能への優先アクセス、ツール統合のためのコンサルティングサービスを含む専門サポートパッケージを導入した。同社はまた、Samsung Electronicsと提携して、Galaxy S24ラインナップでのGemini Nanoの以前の統合に基づいて、将来のGalaxyデバイスでのオンデバイス展開用にGemini 3を最適化した。
開発者は、REST API、PythonおよびJavaScript SDK、コマンドラインインターフェースを通じてGemini 3にアクセスできた。2025年6月に導入されたオープンソースのGemini CLIは、Gemini 3の強化されたツール使用をサポートするように更新され、開発者が自然言語コマンドでターミナルベースのワークフローを自動化できるようにした。
競合他社との比較
Gemini 3は、OpenAIのGPT-4およびGPT-4o、AnthropicのClaude 3およびClaude 4、Metaや他の組織からのオープンソースの代替品によって支配された競争の激しい状況に参入した。Googleは、Gemini 3をこれらの競合他社よりも優れたツール使用信頼性を持つと位置づけ、マルチステップ関数呼び出しシナリオでより少ないエラーを示す内部評価を引用した。
サードパーティの研究者による独立した比較では、Gemini 3が一般的な知識タスクでGPT-4oと競争力があり、特定のコーディングベンチマークで優れていることがわかった。モデルのGoogle検索との統合は、Gemini 2.0で使用されたアプローチと同様に、最新情報を必要とするタスクで利点を提供した。ただし、一部のレビューアは、AnthropicのClaudeモデルが長いコンテキスト推論タスクでより良いパフォーマンスを提供し、Gemini 3がわずかな改善しか示さなかった分野であると指摘した。
Gemini 3のリリースは、より広範なAIハードウェアエコシステムにも影響を与えた。モデルはGoogleのTensor Processing Units(TPU)でトレーニングされ、GoogleはNVIDIA GPUへの依存を減らすためにカスタムシリコンへの投資を継続した。この戦略は、Trainiumチップを備えたAmazon Web Servicesやカスタムアクセラレータを備えたMicrosoft Azureによる同様の取り組みと一致した。
将来の方向性
2025年11月の発売後、Google DeepMindは、Gemini 3が定期的なアップデートを受け、ツール使用をより多くのドメインに拡大し、マルチエージェントコラボレーションを改善することに焦点を当てることを示した。同社はまた、言語モデルと物理世界の対話を組み合わせる以前の研究に基づいて、Gemini 3をWaymoの自動運転システムや他のロボット工学アプリケーションと統合することを模索した。
Googleは、Gemini 3をより多くの言語で利用可能にし、リアルタイムアプリケーションのレイテンシを削減する計画を発表した。同社はまた、米国と英国の政府機関と結果を共有する以前の慣行に沿って、継続的な安全性テストに取り組んだ。発売日時点で、Gemini 3は英語で利用可能であり、その後のリリースで追加の言語サポートが期待された。