Google Gemini 2.0 の発表

英語からの翻訳

Googleは2024年12月11日に、Gemini 2.0 Flash Experimentalをリリースした。これは、ネイティブな[[tool-use|ツール使用]]、マルチモーダル出力、リアルタイムの音声・映像対話を備えたエージェント型AIモデルであり、自律型AIシステムへの移行を示すものである。

Google Gemini 2.0は、Google DeepMindによって開発されたマルチモーダル大規模言語モデルのファミリーであり、2024年12月11日にGemini 1.0および1.5シリーズの後継として発表された。最初のリリースであるGemini 2.0 Flash Experimentalは、ネイティブなツール使用とマルチモーダル出力を導入し、モデルが外部アプリケーションと対話し、画像や音声を直接生成することを可能にした。これは「エージェント型」AIとして位置づけられ、人間の監督を最小限に抑えて多段階のタスクを実行するように設計されており、初期モデルの純粋に会話的な能力からの転換を示すものだった。

この発表は、Googleのより広範なAI戦略における重要な一歩であり、Gemini 2.0を検索、Chrome、開発者ツールを含むエコシステム全体に統合するものだった。このモデルは、Google CloudのVertex AIおよびAI Studioプラットフォームを通じて利用可能となり、開発者向けの公開プレビューが提供された。このリリースはまた、より自律的なAIシステムを目指す競争において、OpenAIAnthropicとの競争激化を示すものでもあった。

開発と背景

Gemini 2.0は、Google BrainとDeepMindが統合されたエンティティであるGoogle DeepMindによって、CEOデミス・ハサビスのリーダーシップの下で開発された。このプロジェクトは、2023年12月6日にUltra、Pro、Nanoの各バージョンで導入されたオリジナルのGeminiモデルの基盤の上に構築された。2.0シリーズは、初期モデルの限界、特に推論、ツール使用、リアルタイム対話における限界に対処することを目的としていた。

報告によると、開発には数百人のエンジニアが関与し、トレーニングにはGoogle独自のテンソル処理ユニット(TPU)が使用された。このモデルは、前世代のマルチモーダルアプローチと一貫して、テキスト、画像、音声、動画を含む多様なデータでトレーニングされた。Gemini開発を支援するために召還されていたGoogleの共同創業者サーゲイ・ブリンは、再び中核的な貢献者として評価された。

この発表は、モデルが旅行の予約、メールの管理、コーディングなどのタスクを自律的に実行できるエージェント型AIへの業界全体の動きの中で行われた。Googleの生成AIへの取り組みは、市場を支配していたOpenAIのGPT-4やAnthropicのClaudeへの直接的な対応と見なされていた。ハサビスは、Gemini 2.0が高度な推論と現実世界での行動能力を組み合わせるものであり、彼がAIにおける「新たなフロンティア」と表現した能力であると強調した。

主な特徴

Gemini 2.0 Flash Experimentalは、初期モデルとは一線を画すいくつかの新しい機能を導入した。

  • ネイティブなツール使用: モデルは、Google検索などの外部ツールやAPIを直接呼び出し、リアルタイム情報を取得してアクションを実行できた。これにより、データベースの照会、ソフトウェアの制御、人間の介入なしでのWebサービスとの対話などのタスクが可能になった。
  • マルチモーダル出力: 主にテキストを生成していた以前のモデルとは異なり、Gemini 2.0は画像と音声をネイティブに生成できた。悪用を防ぐための透かし機能付きの制御可能なテキスト読み上げ機能と、ユーザープロンプトに基づいた文脈に沿った画像を生成する機能が含まれていた。
  • マルチモーダルLive API: このAPIにより、リアルタイムの音声およびビデオ対話が可能になり、アプリケーションがライブストリームを処理して応答できるようになった。仮想アシスタント、翻訳サービス、インタラクティブな学習ツールなどのユースケース向けに設計された。
  • エージェント型機能: モデルは多段階の推論と計画のために最適化され、複雑なタスクをサブタスクに分解して順次実行できるようになった。これは、段階的なプロンプトを必要とした以前のモデルとの重要な差別化要因だった。
  • 統合されたGoogle検索: Gemini 2.0はWebから最新情報にアクセスでき、応答の正確性と関連性が向上した。

これらの機能は、ほとんどの最新の大規模言語モデルの基盤であるトランスフォーマーアーキテクチャ上に構築されたが、効率とパフォーマンスを向上させるためのアテンション機構混合エキスパート層の拡張が加えられた。

発表と利用可能性

Gemini 2.0 Flash Experimentalは、2024年12月11日にブログ投稿と仮想プレスイベントを通じて発表された。当初はGoogle AI StudioとVertex AIを通じて開発者向けに利用可能となり、Geminiアプリを通じて消費者向けの公開プレビューも提供された。このモデルは実験段階では無料で提供され、フィードバックを収集して技術を洗練させる戦略だった。

Googleはまた、Gemini 2.0を自社製品に統合した。2024年2月にBardに取って代わったGeminiチャットボットは、新しいモデルを使用するように更新された。Chromeには、オンデバイス版であるGemini Nanoのバージョンが搭載され、ローカルAI機能が可能になった。さらに、GoogleはGemini 2.0を検索に組み込む計画を発表し、モデルがAI編成の検索結果を生成できるようにした。

このリリースには、Samsungとのパートナーシップが伴い、Galaxy S24シリーズへのGemini NanoとProの統合に続き、Gemini 2.0をGalaxyデバイスに提供することになった。Googleはまた、開発者向けにAndroidでモデルを利用可能にし、そのリーチを拡大した。

パフォーマンスとベンチマーク

Googleは、Gemini 2.0 Flashが、Massive Multitask Language Understanding(MMLU)テストを含むいくつかの業界ベンチマークで以前のモデルを上回り、90%を超えるスコアを達成し、人間の専門家のパフォーマンスを上回ったと主張した。このモデルはまた、Graduate-Level Google-Proof Q&A(GPQA)ベンチマークなどの推論タスクや、HumanEvalで測定されるコード生成においても改善を示した。

発表時点での独立した評価は限られていたが、初期のレビューでは、特にマルチモーダル入力の処理におけるモデルの速度と効率が注目された。Flashバリアントは低遅延アプリケーション向けに設計されており、リアルタイム対話に適していた。Googleはまた、リソースが制約された環境向けに、より小型で効率的なバージョンであるGemini 2.0 Flash Liteもリリースした。

これらの進歩にもかかわらず、一部の専門家は、ベンチマークが特に信頼性の高いツール使用とエラー回復を必要とするエージェント型タスクにおいて、現実世界のパフォーマンスを完全には捉えていない可能性があると警告した。モデルの画像と音声を生成する能力は、潜在的な悪用に関する懸念も引き起こしたが、Googleはリスクを軽減するために透かしと安全フィルターを実装した。

エージェント型AIと業界への影響

Gemini 2.0の発表は、モデルがプロンプトに単に応答するのではなく自律的に行動するように設計されているエージェント型AIへの広範なトレンドの一部だった。この変化は、フォームへの記入や製品の比較などのタスクを実行するためにGemini 2.0を使用してWebブラウザを操作する研究プロトタイプであるProject Marinerなど、Googleが「エージェント型体験」を重視していることに明らかだった。

業界アナリストは、このリリースを、同様のエージェント型機能に取り組んでいたOpenAIへの直接的な挑戦であり、そのClaudeモデルにツール使用を導入していたAnthropicへの挑戦でもあると見なした。MicrosoftAmazonなどの企業がAWS TrainiumAzureのAIサービスなどのカスタムチップを含むAIインフラストラクチャに多額の投資を行ったため、競争は激化した。

Googleの動きは、より広範なAIエコシステムにも影響を及ぼした。Gemini 2.0をGoogle Cloudで利用可能にすることで、同社はAI-as-a-service市場の主要プレーヤーとしての地位を確立し、OpenAIの提供物やAnthropicのAPIと競合した。Google検索との統合は、モデルがリアルタイムデータにアクセスできるという独自の利点をもたらし、競合他社にはない機能だった。

安全性と倫理的考慮事項

Googleは、Gemini 2.0の開発において安全性を優先事項として強調した。同社は、リリース前にレッドチーム演習やバイアス評価を含む広範なテストを実施したと述べた。モデルには有害なコンテンツ生成を防ぐための安全フィルターが含まれており、AI生成画像と音声の透かしは、合成メディアの識別に役立つことを目的としていた。

2023年10月に米国大統領ジョー・バイデンが署名した大統領令に沿って、Googleは安全性テストの結果を連邦政府と共有した。同社はまた、ブレッチリー・パークでのAI安全サミットを含む国際機関とも連携し、世界的な基準に沿うようにした。

しかし、Gemini 2.0のエージェント型の性質は、新たな倫理的疑問を提起した。購入やメッセージ送信など、ユーザーに代わって行動する能力は、意図しない結果のリスクをもたらした。Googleはこれらの懸念を認め、ユーザーの同意メカニズムや自律的行動の制限などの安全策を実装すると述べた。

今後の展開

実験的リリースに続いて、Googleはユーザーフィードバックに基づいてGemini 2.0を反復開発する計画を立てていた。同社は、2025年初頭にリリースされる予定のより強力なバージョンであるGemini 2.0 Proを示唆し、オープンソースのGemmaモデルを含むGeminiファミリーの開発を継続した。

2025年6月、GoogleはGemini CLIを導入した。これは、Geminiの機能をターミナルにもたらすオープンソースのAIエージェントであり、高度なコーディングと自動化機能を提供し、個人開発者には寛大な無料利用枠を提供した。この動きは、消費者向けアプリケーションを超えてGeminiのリーチを拡大するというGoogleのコミットメントを強調するものだった。

Gemini 2.0の発表は、人工知能の進化における極めて重要な瞬間と見なされ、会話型アシスタントからデジタル世界で動作できるプロアクティブなエージェントへの移行を示すものだった。技術が成熟するにつれて、生産性、創造性、人間とコンピューターの相互作用に深遠な影響を与える可能性が高い。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:google-deepmind·large-language-model·ai-launch·generative-ai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴