Gemini 2023年12月

英語からの翻訳

Geminiは、Google DeepMindによって開発されたマルチモーダル大規模言語モデルのファミリーであり、2023年12月6日に発表され、3つのティア(Ultra、Pro、Nano)を持ち、BardやPixel 8などのGoogle製品に統合されている。

Geminiは、Googleの子会社であるGoogle DeepMindによって開発された、マルチモーダル大規模言語モデル(LLM)のファミリーである。2023年12月6日に発表され、Geminiはそれ以前のGoogleモデルであるLaMDAやPaLM 2の後継として位置づけられている。テキスト、画像、音声、動画、コンピュータコードなど、複数の種類のデータを同時に処理できるように設計されており、多くのテキスト専用LLMとは一線を画している。Geminiという名称は星座を指すとともに、Google BrainとDeepMindの合併、およびNASAのジェミニ計画にも言及している。

発表では、高度に複雑なタスクを対象としたGemini Ultra、幅広いタスクに対応するGemini Pro、デバイス上のタスクに最適化されたGemini Nanoという3つのモデル階層が導入された。発表時点で、Gemini ProはGoogleのBardチャットボットに統合され、Gemini NanoはPixel 8 Proスマートフォンの機能を強化した。Gemini Ultraは2024年初頭に「Bard Advanced」という名称でリリースされる予定だった。モデルは当初英語のみで利用可能であり、Googleはより広範な展開前に大規模な安全性テストが必要であると述べた。

開発

Googleは2023年5月10日のGoogle I/O基調講演で初めてGeminiを発表し、CEOのサンダー・ピチャイは、同じイベントで公開されたPaLM 2のより強力な後継であると説明した。典型的なLLMとは異なり、Geminiは当初からマルチモーダルシステムとして設計され、テキスト、画像、音声、動画、コードにわたる理解と生成が可能である。開発はDeepMindとGoogle Brainの協力によるもので、両者はその年の初めにGoogle DeepMindとして合併していた。

DeepMindのCEOであるデミス・ハサビスは、GeminiがGPT-4上で動作するOpenAIのChatGPTを凌駕する可能性を強調した。彼は2016年に囲碁チャンピオンの李セドルを破ったDeepMindプログラムであるAlphaGoとの類似点を挙げ、GeminiがAlphaGoの強みと高度な言語能力を組み合わせることを示唆した。2023年8月、The Informationは、Googleが2023年末のローンチを目指しており、画像生成やその他のマルチモーダル機能を統合して競合他社を凌駕する計画があると報じた。

Googleの共同創業者であるセルゲイ・ブリンは、Geminiの開発を支援するために引退から復帰し、「中核的な貢献者」としてクレジットされた。Google BrainとDeepMindの数百人のエンジニアがこのプロジェクトに携わった。GeminiはYouTube動画の文字起こしで訓練されたため、潜在的に著作権で保護された素材を除外するために弁護士が関与した。

発表と初期リリース

2023年12月6日、ピチャイとハサビスはオンライン記者会見でGemini 1.0を発表した。複雑なタスク用のUltra、一般的なタスク用のPro、デバイス上のアプリケーション用のNanoという3層構造が明らかにされた。発表時点で、Gemini ProはBardに統合され、Gemini NanoはPixel 8 Proに組み込まれた。Gemini Ultraは2024年初頭に予定され、「Bard Advanced」を強化し、開発者にも提供される予定だった。GoogleはGeminiを検索、広告、Chrome、Google WorkspaceのDuet AI、AlphaCode 2に組み込む意向を示した。

GeminiはGoogleのTensor Processing Units(TPU)で訓練された。Googleはこれを「最大かつ最も高性能なAIモデル」と宣伝し、人間の行動を模倣するように設計されたと述べた。同社は、安全性テストの要件により、Geminiが翌年まで広く利用可能にならないと述べた。2023年10月にジョー・バイデン大統領が署名した米国の大統領令に沿って、GoogleはGemini Ultraのテスト結果を連邦政府と共有することに合意した。英国政府との協議も、11月のブレッチリー・パークでのAI安全サミットの原則に沿うことを目的としていた。

Gemini Ultraは、業界ベンチマークでGPT-4、AnthropicのClaude 2、Inflection AIのInflection-2、MetaのLLaMA 2、xAIのGrok 1を上回ったと報じられた。Gemini ProはGPT-3.5を上回るとされた。Gemini Ultraは、57科目のMassive Multitask Language Understanding(MMLU)テストで人間の専門家を初めて上回り、90%のスコアを達成した最初の言語モデルとなった。Gemini Proは2023年12月13日にAI StudioとVertex AIを通じてGoogle Cloud顧客に提供された。

統合と拡大

2024年1月、GoogleはSamsungと提携し、Gemini NanoとGemini ProをGalaxy S24スマートフォンシリーズに統合した。翌月、BardとDuet AIはGeminiブランドの下で統合され、「Gemini Advanced with Ultra 1.0」がGoogle Oneの新しい「AI Premium」層を通じて開始された。Gemini Proもグローバルに展開された。

2024年2月、GoogleはGemini 1.5を発表し、1.0 Ultraよりも強力で、新しいアーキテクチャ、混合専門家アプローチ、100万トークンのコンテキストウィンドウを備えていると説明した。同月、GoogleはGeminiモデルのより小型でオープンソースの範囲であるGemmaを発表し、MetaなどがAIモデルをオープンソース化していることへの対応と見なされた。

2024年5月14日のGoogle I/O基調講演で、Googleはより高速で効率的なモデルであるGemini 1.5 Flashを発表した。また、デスクトップ最適化版のGemini NanoをGoogle Chromeブラウザに「Built-in AI」アーキテクチャを通じて統合する計画も明らかにされ、Prompt API(「window.ai」)などの実験的APIを通じて、ローカル処理機能をウェブ開発者に公開する予定である。

その後の更新

2024年9月24日に、更新された2つのモデル、Gemini-1.5-Pro-002とGemini-1.5-Flash-002がリリースされた。2024年12月11日、GoogleはGemini 2.0 Flash Experimentalを発表し、リアルタイムの音声および動画インタラクションのためのMultimodal Live API、ネイティブ画像生成、透かし付きの制御可能なテキスト読み上げ、統合されたGoogle検索を備えていた。

2025年6月、GoogleはGemini CLIを導入した。これはオープンソースのAIエージェントで、Geminiの機能をターミナルにもたらし、コーディング、自動化、問題解決機能を提供し、個人開発者には寛大な無料利用制限を提供する。

技術的アーキテクチャと機能

Geminiは、他の現代のLarge language modelと同様に、Transformer (architecture)アーキテクチャに基づいて構築されている。シーケンシャルデータを処理するために、Multi-Head AttentionメカニズムとPositional Encodingを採用している。モデルはマルチモーダルであり、多様なデータタイプで訓練され、訓練と推論にGoogleのTPUを使用している。Geminiの設計には、Mixture of experts(後のバージョン)などの技術が組み込まれており、大きなコンテキストウィンドウをサポートし、長いドキュメントや複雑な推論タスクを処理できる。

Geminiの機能には、自然言語理解、コード生成、画像および音声処理、外部ツールとの統合が含まれる。モデルは、Bardなどの消費者向けアプリケーションからGoogle Cloud上のエンタープライズソリューションまで、さまざまなドメインに適応できるように設計されている。

影響と評価

Geminiの発表は、Generative AI分野、特にOpenAIのGPT-4やAnthropicのClaudeモデルとの競争を激化させた。GoogleはGeminiをこれらのシステムへの直接的な挑戦者として位置づけ、検索、Workspace、CloudなどのGoogleエコシステムとの深い統合を活用した。モデルのマルチモーダルな性質は、より人間らしいAIへの重要なステップと見なされ、ハサビスがロボティクスとの組み合わせによる物理的インタラクションの可能性を示唆したように、ロボティクスへの応用が期待された。

業界アナリストは、MMLUなどのベンチマークでのGeminiの強力なパフォーマンスを指摘したが、安全性、バイアス、大規模モデルの訓練による環境への影響についての懸念も提起した。GoogleがGemmaをオープンソース化した決定は、コミュニティの採用を促進し、プロプライエタリAIへの批判に対処するための戦略的な動きと見なされた。

将来の方向性

GoogleはGeminiを進化させ続けており、継続的な更新と新しいモデルバージョンが行われている。ChromeやAndroidデバイスへのGeminiの統合は、オンデバイスAIを幅広いユーザーに提供することを目指している。Gemini CLIやその他のツールの開発は、開発者中心のアプリケーションへの焦点を示唆している。2025年現在、GeminiはGoogleのAI戦略の中心的な部分であり、この分野の他の主要プレーヤーと競争している。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:ai-model·google-deepmind·large-language-model·multimodal-ai
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴