Google Gemini 2.5 の発表

英語からの翻訳

Google Gemini 2.5は、推論とコーディング能力が強化された思考モデルであり、Google DeepMindが開発したマルチモーダル大規模言語モデルのGeminiファミリーの一部として、2025年3月にリリースされた。

Google Gemini 2.5は、Google DeepMindによって開発されたマルチモーダル大規模言語モデル(LLM)のファミリーであり、2025年3月にリリースされた。これは以前のGeminiバージョンの後継であり、応答を生成する前に問題を段階的に推論できる「思考モデル」として設計され、特にコーディングと複雑な推論タスクにおいて改善が見られる。このリリースは、2023年12月の当初のGemini発表によって築かれた基盤の上に、高度なAIを自社製品とクラウドサービスに統合するというGoogleの戦略を継続するものであった。

Gemini Pro、Gemini Flash、Gemini Nanoなどのモデルを含むGeminiファミリーは、2023年12月6日にLaMDAとPaLM 2の後継として初めて発表された。Gemini 2.5は、強化された推論能力と、ソフトウェア開発、数学、科学的問題解決におけるパフォーマンス向上に焦点を当てた、重要な進化を表している。この発売は、より意図的に「考える」ことができるモデルへのAI業界の広範なトレンドの一部であり、より直接的に応答を生成していた初期のモデルとは対照的である。

開発と背景

Geminiの開発は2025年の発売のかなり前から始まっていた。2023年5月10日のGoogle I/O基調講演で、Google CEOのサンダー・ピチャイは、GeminiをPaLM 2のより強力な後継として発表し、そのマルチモーダルな性質(テキスト、画像、音声、動画、コードを同時に処理するように設計されていること)を強調した。このプロジェクトは、DeepMindとGoogle Brainのコラボレーションであり、両者は合併してGoogle DeepMindとなった。DeepMindのCEOであるデミス・ハサビスは、Geminiが2016年に囲碁チャンピオンのイ・セドルを破ったプログラムであるAlphaGoの強みと、高度な言語能力を組み合わせることを強調した。

2023年8月までに、Googleは2023年末までにGeminiを発売することを目指しており、画像生成と文脈理解を統合することでOpenAIなどの競合他社を凌駕する計画があると報じられた。Googleの共同創業者であるセルゲイ・ブリンが支援のために呼び戻され、Google BrainとDeepMindから数百人のエンジニアが貢献した。法務チームは、YouTubeのトランスクリプトを含むトレーニングデータから潜在的に著作権で保護された素材をフィルタリングした。

2023年12月6日に発表された当初のGemini 1.0には、非常に複雑なタスク用のUltra、幅広いタスク用のPro、デバイス上のタスク用のNanoの3つのモデルが含まれていた。Gemini Ultraは、57科目のMassive Multitask Language Understanding(MMLU)テストで人間の専門家を上回るパフォーマンスを発揮した最初のLLMであり、90%のスコアを達成した。モデルはGoogleのTensor Processing Units(TPU)でトレーニングされた。

思考モデルアプローチ

Gemini 2.5は、AIが最終的な回答を生成する前に明示的に問題を推論する「思考モデル」パラダイムを導入した。このアプローチは、他の高度なLLMで使用される技術と同様であり、モデルが複雑なクエリを中間ステップに分解し、精度と論理的一貫性を向上させることを可能にする。思考プロセスは常にユーザーに表示されるわけではなく、一部の構成ではモデルが推論の簡潔な要約を提供する一方、他の構成では完全な思考連鎖を表示できる。

この設計は、段階的なデバッグとアルゴリズム設計が重要であるコーディングタスクに特に有益である。Gemini 2.5モデルは、実際のソフトウェアエンジニアリングの問題をテストするSWE-Benchなどのコーディングベンチマークで最先端の結果を達成したと報告された。強化された推論は、数学的証明、科学的推論、多段階計画にも及ぶ。

思考モデルアーキテクチャは、ほとんどの現代のLLMの基盤となるトランスフォーマーフレームワークに基づいている。これはマルチヘッドアテンション思考連鎖プロンプティングなどの技術を組み込んでいるが、モデルが応答する前に内部的に推論するようにトレーニングされる、より統合されたアプローチを採用している。

リリースと入手可能性

Gemini 2.5は2025年3月にリリースされ、初期の展開はProとFlashのバリアントに焦点を当てていた。モデルは、Google CloudのVertex AIやAI StudioなどのGoogleのAIプラットフォーム、およびGeminiチャットボットを通じて利用可能になった。開発者はAPIを介してモデルにアクセスでき、価格は他の商用LLMと同様にトークンごとに設定された。

このリリースには、Googleの消費者向け製品のアップデートが伴っていた。例えば、Gemini 2.5はAndroidおよびiOS用のGeminiアプリに統合され、後にGoogle検索のAI Overviewsにも統合された。モデルはまた、Android StudioやColabなどのGoogleの開発者ツール内のコーディングアシスタントを強化した。

2025年6月、GoogleはGemini CLIを導入した。これはGeminiの機能をターミナルに直接もたらすオープンソースのAIエージェントであり、高度なコーディング、自動化、問題解決機能を提供し、個人開発者には寛大な無料利用枠を提供する。この動きは、コマンドラインインターフェースを好む開発者を引き付けることを目的としていた。

パフォーマンスとベンチマーク

Gemini 2.5モデルは、前身と比較して大幅なパフォーマンス向上を示した。57科目にわたる知識をテストするMMLUベンチマークでは、Gemini 2.5 Proが90%を超えるスコアを達成し、以前のGemini Ultraを上回ったと報告された。HumanEvalやSWE-Benchなどのコーディングベンチマークでは、モデルは顕著な向上を示し、Gemini 2.5 Proは以前のバージョンと比較して、実際のGitHubの問題を解決する割合が高かった。

モデルはまた、GPQA(Graduate-Level Google-Proof Q&A)やAIME(American Invitational Mathematics Examination)などの推論ベンチマークでも優れており、科学と数学における強力な能力を示した。これらの結果により、Gemini 2.5は競争の激しい環境で主要なモデルとして位置づけられ、OpenAI(GPT-4やそれ以降のモデルなど)やAnthropic(Claude 3やそれ以降)などの提供と競合した。

しかし、独立した評価では、Gemini 2.5は非常に有能である一方、長いコンテキストの検索や幻覚の回避など、特定の領域では依然として限界があることが指摘された。Googleは反復を続け、安定性と効率性が向上した更新バージョンをリリースした。

Googleエコシステムとの統合

Gemini 2.5はGoogleの製品スイートに深く統合された。Google Cloudプラットフォームでは、エンタープライズ向けの中核的な提供となり、ドキュメント要約、コード生成、カスタマーサポートの自動化などのユースケースを可能にした。モデルはまた、Google Workspaceを通じて利用可能であり、メールの下書き作成、プレゼンテーションの作成、Sheetsでのデータ分析を支援した。

消費者側では、Gemini 2.5がGeminiチャットボットを強化し、2024年2月にBardからブランド名が変更された。チャットボットは画像や音声を含むマルチモーダル入力を処理でき、リアルタイムの応答を提供した。さらに、Gemini 2.5はAndroidデバイスでも使用され、テキスト要約やスマートリプライなどのタスクのためにオンデバイス推論を利用し、効率性のためにNanoバリアントを活用した。

Googleはまた、Geminiのリーチを拡大するために他の企業と提携した。例えば、2024年1月、GoogleはSamsungと提携し、Galaxy S24スマートフォンラインナップにGemini NanoとProを統合した。このようなコラボレーションは、GoogleがAppleのオンデバイスAIや他のエコシステムプレーヤーと競争するのに役立った。

競争環境

Gemini 2.5の発売は、AI業界の競争を激化させた。OpenAIはGPT-4をリリースし、GPT-4.5とGPT-5に取り組んでいた一方、AnthropicはClaude 3とそれ以降のモデルを提供していた。Meta(LLaMAを使用)やAI21 LabsInflection AIなどのスタートアップを含む他のプレーヤーも市場シェアを争った。

Gemini 2.5の推論とコーディングへの重点は、OpenAIのCodexやAnthropicのClaude Codeへの直接的な挑戦と見なされた。Googleの利点は、TPUやGoogle Cloudデータセンターを含む広大なインフラストラクチャにあり、効率的なトレーニングと展開を可能にした。同社はまた、強化学習とニューラルネットワーク設計で確かな実績を持つGoogle DeepMindからの研究専門知識を活用した。

競争にもかかわらず、Gemini 2.5は、特にすでにGoogle Cloudを使用している開発者やエンタープライズの間で勢いを増した。GitHub Copilotなどの人気ツールとの統合(プラグインを通じて)と、複数の地域での利用可能性が、その採用に貢献した。

将来の方向性

2025年3月の発売後、GoogleはGemini 2.5の反復を続け、パフォーマンスを向上させ、レイテンシを削減するためのマイナーアップデートをリリースした。同社はまた、さらに大きなコンテキストウィンドウとより効率的なアーキテクチャを備えた将来のバージョンを示唆した。ビデオやリアルタイムインタラクションを含むマルチモーダル理解への研究は進行中であり、Geminiをより汎用的なAIアシスタントにすることを目指していた。

Googleはまた、デミス・ハサビスが2023年に言及していたように、Geminiとロボティクスを組み合わせる可能性を探求し、物理世界とのインタラクションを可能にする可能性があった。さらに、同社は安全性と整合性に焦点を当て、テスト結果を政府と共有し、2023年10月に米国大統領ジョー・バイデンが署名した大統領令などの規制枠組みを順守した。

Gemini 2.5のリリースは、大規模言語モデルの進化におけるマイルストーンを示し、より深く推論できる「思考」モデルの実現可能性を実証した。AI分野が進歩するにつれて、そのようなモデルは標準になる可能性が高く、ソフトウェア開発、教育、科学研究に影響を与える。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·google-deepmind·large-language-model·event
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴