Google Gemini 3 推論版のリリース

英語からの翻訳

2025年11月にGoogle DeepMindがリリースしたGemini 3は、推論能力と段階的思考能力が強化されたマルチモーダル大規模言語モデルであり、Gemini 2.0の後継としてGeminiチャットボットを支えている。

Gemini 3は、Google DeepMindが開発したマルチモーダル大規模言語モデル(LLM)のファミリーであり、2025年11月にリリースされた。これは、2024年12月に発表されたGemini 2.0の後継として機能し、2023年12月にGemini 1.0で始まったGemini系統を継続している。このモデルは、推論の強化と段階的思考に焦点を当てて設計されており、数学、科学、コーディングなどの分野で複雑な問題をより高い透明性と精度で解決できるようにしている。Gemini 3はGeminiチャットボットを支え、Vertex AIやAI Studioを含むGoogle Cloudサービス、およびターミナルベースの対話用のGemini CLIを通じて利用可能である。

Gemini 3のリリースは、テキスト、画像、音声、動画、コードを同時に処理するマルチモーダルAIを推進するGoogle DeepMindの軌跡に基づいている。広範な能力を重視した初期バージョンとは異なり、Gemini 3は、最終的な回答に到達する前に中間ステップを明示的に生成する洗練された推論エンジンを導入している。この機能は、しばしば連鎖思考推論と呼ばれ、モデルがその論理を説明し、自身の結論を検証し、多段階タスクでのエラーを減らすことを可能にする。2025年11月のローンチは、Gemini 3をOpenAIAnthropicの他のフロンティアモデルに対する直接の競争相手として位置づけ、Googleは推論ベンチマークでの優れた性能と、Search、Workspace、Androidを含むGoogleのエコシステム全体への統合を強調した。

開発と背景

Gemini 3の開発は、2024年12月のGemini 2.0リリース直後に始まり、リアルタイムの音声・動画対話のためのMultimodal Live API、ネイティブ画像生成、統合されたGoogle Searchなどの機能が導入された。CEOのDemis Hassabisが率いるGoogle DeepMindは、2016年に名声を得たAlphaGoプログラムを含む初期モデルからの洞察を活用して、Gemini 3の推論能力を設計した。このモデルは、カスタムのMachine learningアクセラレータであるGoogleのTensor Processing Units(TPU)でトレーニングされ、効率とスケーラビリティを向上させるためにmixture-of-expertsアーキテクチャを組み込んだ。このアプローチにより、モデルは各クエリに対して関連するサブネットワークのみをアクティブ化し、計算コストを削減しながら高いパフォーマンスを維持できる。

開発中、Google DeepMindはさまざまな研究機関と協力し、Deep learningおよびNeural network設計の進歩を活用した。チームには、2023年に統合されたGoogle BrainとDeepMindの両方のエンジニアが含まれ、初期のGeminiバージョンへのコア貢献者としてクレジットされた共同創設者Sergey Brinからの貢献も受けた。トレーニングプロセスには、YouTube動画のトランスクリプトを含む大規模なデータセットが関与し、法務チームが潜在的に著作権で保護された素材をフィルタリングした。以前のリリースと同様に、Googleは安全性テストを強調し、米国の大統領令やBletchley ParkでのAI安全サミットでの国際協定に従い、評価結果を米国および英国の政府機関と共有した。

ローンチと利用可能性

Gemini 3は、2025年11月の仮想記者会見で正式に発表され、Google CEOのSundar PichaiとDemis Hassabisが新しいモデルを紹介した。ローンチには複数のバリアントが含まれた:幅広いタスク向けに設計されたGemini 3 Pro、高度に複雑な推論向けのGemini 3 Ultra、速度と効率に最適化されたGemini 3 Flash、およびオンデバイスアプリケーション向けのGemini 3 Nano。ローンチ時点で、Gemini 3 ProとNanoはそれぞれGeminiチャットボットと一部のAndroidスマートフォンに統合され、Gemini 3 UltraはGoogle CloudのVertex AIおよびAI Studioプラットフォームを通じて開発者に利用可能になった。このモデルは当初英語でリリースされ、その後の数ヶ月で多言語展開の計画があった。

Googleはまた、モデルの能力を開発者のターミナルにもたらすオープンソースのコマンドラインツールであるGemini 3 CLIを導入し、高度なコーディング、自動化、問題解決機能を寛大な無料利用制限付きで提供した。この動きは、2025年6月にリリースされ、個人開発者の間で人気を博したGemini CLIの以前のリリースを反映したものだった。11月のローンチには、2024年1月のGemini 1.5での同様のコラボレーションに続き、Gemini 3をGalaxy S26スマートフォンラインナップに統合するためのSamsung Electronicsとのパートナーシップが伴った。さらに、GoogleはGemini 3がエンタープライズ顧客向けにGoogle Cloudで利用可能になり、使用量とモデルバリアントに基づく価格帯が設定されると発表した。

強化された推論能力

Gemini 3の特徴的な機能は、その強化された推論であり、モデルが最終出力を生成する前に段階的思考プロセスを生成できるようにする。この能力は、高度な数学、科学的問題解決、コード生成など、論理的演繹を必要とする領域で特に顕著である。ベンチマークテストでは、Gemini 3 Ultraは、Massive Multitask Language Understanding(MMLU)テストで、Gemini 2.0やOpenAIのGPT-4などの競合他社を含む以前のモデルを上回り、90%以上のスコアを達成したと報告された。このモデルはまた、マルチホップ質問や因果推論を含む専門的な推論ベンチマークでの改善されたパフォーマンスを示した。

段階的思考は、Chain-of-thoughtプロンプティング、人間のフィードバックからのReinforcement learning(RLHF)、およびReinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)を含む技術の組み合わせを通じて実装されている。これらの方法により、モデルは複雑なクエリをより小さく管理可能なサブ問題に分解し、それぞれを解決し、結果を統合できる。このアプローチは精度を向上させるだけでなく、モデルがどのように回答に到達したかの透明な説明をユーザーに提供し、デバッグ、教育、信頼構築に役立つ。ただし、推論プロセスは遅延を増加させる可能性があり、Googleはリアルタイムアプリケーション向けに速度と推論の深さのバランスを取るためにGemini 3 Flashを最適化した。

マルチモーダルおよび統合機能

Gemini 3は、その前身のマルチモーダルな伝統を継続し、テキスト、画像、音声、動画、コードを同時に処理する。このモデルは、テキスト記述から画像を生成し、制御可能なテキスト読み上げで音声応答を作成し、リアルタイムで動画コンテンツを分析できる。注目すべき追加機能は、リアルタイムの音声・動画対話をサポートするMultimodal Live APIであり、仮想アシスタント、翻訳サービス、インタラクティブな教育ツールなどのアプリケーションを可能にする。ネイティブ画像生成には、AI作成コンテンツを識別するための透かしが含まれており、誤情報に関する懸念に対処している。

Googleのエコシステムとの統合は広範囲にわたる。Gemini 3はGoogle Searchの機能を強化し、複雑なクエリに対してより詳細で推論された回答を提供する。Google Workspaceでは、Duet AIを強化し、ドキュメントの下書き、スプレッドシート分析、メール作成を支援する。Androidでは、Gemini 3 Nanoが要約やスマート返信などのタスクのオンデバイス処理を可能にし、データがデバイス上に残るためプライバシー上の利点がある。このモデルはまた、Google Cloudサービスと統合され、開発者がAPIおよびSDKを使用してカスタムアプリケーションを構築できるようにする。さらに、Gemini 3は外部ツールやデータベースとの統合をサポートし、最新情報にアクセスして、予約の予約やビジネスシステムのクエリなどのアクションを実行できる。

パフォーマンスとベンチマーク

独立した評価では、Gemini 3はさまざまなベンチマークで強力なパフォーマンスを示した。57の科目をカバーするMMLUテストでは、Gemini 3 Ultraは92%のスコアを達成し、人間の専門家のパフォーマンスを上回り、Gemini 1.0 Ultraが達成した90%のスコアを超えた。HumanEvalやCodeforcesなどのコーディングベンチマークでは、Gemini 3 ProはGPT-4やClaude 3.5を上回り、生成されたコードの合格率が高く、問題仕様への準拠が優れていた。数学的推論では、このモデルはMATHデータセットの問題、特に多段階の導出を必要とする問題のより高い割合を解決した。

ただし、一部の研究者は、Gemini 3の推論の改善にはトレードオフが伴うと指摘した。モデルの段階的思考は冗長になる可能性があり、場合によっては単純なクエリを過剰に説明し、トークン使用量の増加と計算コストの上昇につながる。Googleは、ユーザーが簡潔な説明と詳細な説明の間で選択できる設定可能な推論深度を提供することでこれに対処した。さらに、Gemini 3は構造化された推論タスクで優れている一方、オープンエンドの創造的執筆でのパフォーマンスは以前のモデルと同等であり、独創性やスタイルの多様性に大きな向上は見られなかった。

競争環境

Gemini 3のリリースは、Large language model市場での競争を激化させた。GPT-4をリリースしGPT-5を開発中だったOpenAIは、段階的思考も採用したo1シリーズなどの独自の推論重視モデルを加速させることで対応した。Anthropicは、Claude 3.5およびClaude 4モデルで、安全性と解釈可能性を強調し、AIアライメントに関心のあるエンタープライズクライアント向けの代替手段として自らを位置づけた。meta(LLaMA 3を使用)、Mistral AIxAI(Grok 3を使用)を含む他のプレイヤーは、オープンソースおよびプロプライエタリモデルをリリースし続けたが、ローンチ時点でGemini 3の報告されたベンチマークスコアに匹敵するものはなかった。

GoogleのGemini 3を製品全体に統合する戦略は、Search、Android、Chromeを通じて何十億ものユーザーがモデルにアクセスできるため、配布上の利点を与えた。ただし、データプライバシーと独占的慣行に関する懸念は、特に欧州連合で規制上の監視につながり、GoogleのAIパートナーシップとデータ処理に関する調査が進行中だった。これに対応して、Googleは責任あるAI開発へのコミットメントを強調し、透明性レポートを公開し、一部の地域でデータ収集のオプトアウトオプションを提供した。

今後の方向性

2025年11月のローンチに続いて、Google DeepMindはGemini 3への反復的なアップデートの計画を発表し、ヘルスケア、金融、教育などの特定業界向けの微調整バージョンを含む。同社はまた、2026年半ばに予想されるGemini 3.5についてほのめかし、Machine learning効率の進歩と、Gemini 1.5で導入された100万トークン能力に基づく、おそらくより大きなコンテキストウィンドウを組み込むと述べた。Hassabisが以前のリリースで言及したロボティクスとGeminiを組み合わせる研究は継続され、制御された環境で物理世界との対話のプロトタイプがテストされた。

さらに、GoogleはAMDQualcommを含む他のテクノロジー企業とのパートナーシップを模索し、エッジデバイス向けにGemini 3を最適化し、クラウドインフラストラクチャへの依存を減らした。オープンソースコミュニティは、2024年2月にリリースされたGemmaモデルと同様の、Gemini 3のより小さな蒸留バージョンへのアクセスを受け取り、研究者が推論技術を実験できるようにした。ローンチ日時点で、Gemini 3はAI推論における重要な前進を表していたが、その長期的な影響は、今後数年間でどのように採用され洗練されるかに依存する。

評価と影響

Gemini 3の初期のレビューは概ね肯定的であり、テクノロジージャーナリストや研究者は、複雑なタスクでの推論の透明性と正確性を賞賛した。教育者は、段階的説明が学生の問題解決プロセスの理解を助けるため、チュータリングツールとしての可能性に注目した。ソフトウェア開発者は、改善されたコード生成とデバッグ支援を評価し、多くの人が日常的なプログラミングタスクに費やす時間が短縮されたと報告した。ただし、一部の批評家は、このような大規模モデルのトレーニングの環境への影響や、説得力のある誤情報の生成やサイバー攻撃の自動化における悪用の可能性について懸念を提起した。

Googleは、データセンターでの再生可能エネルギーの使用とAI安全性研究への投資を強調することで、これらの懸念に対応した。同社はまた、MIT CSAILStanford AI Labなどの学術機関と協力し、推論能力のあるAIの社会的影響を研究した。全体として、Gemini 3のローンチはGenerative AIの進化におけるマイルストーンを示し、大規模言語モデルがパターン認識を超えて、より意図的で論理的な推論に移行できることを実証した。2025年11月時点で、これは利用可能な最も先進的なAIシステムの1つと見なされ、会話型および分析型AIツールからユーザーが期待できるものに新しい基準を設定した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·large-language-model·google-deepmind·machine-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴