Google Geminiのリリース

英語からの翻訳

Geminiは、Google DeepMindによって開発されたマルチモーダル大規模言語モデルのファミリーであり、2023年12月6日にLaMDAとPaLM 2の後継として発表され、Geminiチャットボットを支え、Googleの各製品に統合されている。

Geminiは、Googleの子会社であるGoogle DeepMindによって開発された、マルチモーダル大規模言語モデル(LLM)のファミリーである。2023年12月6日に発表されたGeminiは、Googleの以前のモデルであるLaMDAとPaLM 2の後継として位置づけられている。モデルファミリーには、Gemini Pro、Gemini Deep Think、Gemini Flash、Gemini Flash Liteが含まれ、Geminiチャットボットを支えている。名前は、プロジェクトがGoogle BrainとDeepMindを統合したという二面性を象徴する、ふたご座に由来する。Geminiは、テキスト、画像、音声、動画、コンピューターコードなど、複数のデータタイプを同時に処理できるように設計されており、テキストのみを扱う多くの前任モデルとは一線を画している。

開発の背景

Googleは、2023年5月10日のGoogle I/O基調講演で初めてGeminiを発表し、同じイベントで公開されたPaLM 2のより強力な後継として位置づけた。Google CEOのサンダー・ピチャイは、Geminiがまだ初期の開発段階にあると述べた。テキストコーパスのみで訓練される典型的な大規模言語モデルとは異なり、Geminiは当初からマルチモーダルとして設計され、多様な入力タイプを同時に処理できるようにした。開発は、DeepMindとGoogle Brainの2つの部門が単一のエンティティであるGoogle DeepMindに統合された協力の下で行われた。

Wiredとのインタビューで、DeepMind CEOのデミス・ハサビスは、Geminiの高度な能力を誇示し、GPT-4で動作するOpenAIのChatGPTを凌駕するだろうと示唆した。ハサビスは、2016年に囲碁チャンピオンのイ・セドルを破って世界的な注目を集めたDeepMindのAlphaGoプログラムの強みを強調し、GeminiがAlphaGoの力と他のGoogle・DeepMind LLMを組み合わせると述べた。この野心は、ChatGPTと自社の初期チャットボットであるBardの台頭に対するGoogleの積極的な対応を反映していた。

2023年8月、The InformationはGoogleのGeminiに関するロードマップを報じ、2023年後半の目標発売日を明らかにした。このレポートは、Googleが会話型テキスト機能と人工知能搭載の画像生成を組み合わせることで、OpenAIや他の競合他社を凌駕し、文脈に応じた画像とより広いユースケースを可能にしたいと期待していることを示した。Googleの共同創業者であるサーゲイ・ブリンは、開発を支援するために引退から呼び戻され、Google BrainとDeepMindの数百人のエンジニアとともに参加し、後に「中核的な貢献者」としてクレジットされた。GeminiがYouTubeビデオの書き起こしで訓練されたため、著作権で保護された可能性のある素材を除外するために弁護士が招集された。

発売と初期モデル

2023年12月6日、ピチャイとハサビスはバーチャル記者会見で「Gemini 1.0」を発表した。このリリースは、「非常に複雑なタスク」向けに設計されたGemini Ultra、「幅広いタスク」向けのGemini Pro、「デバイス上のタスク」向けのGemini Nanoの3つのモデルで構成されていた。発売時、Gemini ProとNanoはそれぞれBardとPixel 8 Proスマートフォンに統合された。Gemini Ultraは「Bard Advanced」を支え、2024年初頭にソフトウェア開発者に利用可能になる予定だった。統合が予定されていた他の製品には、Search、Ads、Chrome、Google WorkspaceのDuet AI、AlphaCode 2が含まれていた。初期リリースは英語のみで利用可能だった。

GoogleはGeminiを「最大かつ最も有能なAIモデル」として宣伝し、人間の行動を模倣するように設計されたと述べた。同社は、「広範な安全性テスト」の必要性のため、Geminiを翌年まで広く公開しないと述べた。GeminiはGoogleのTensor Processing Units(TPU)で訓練され、それによって駆動された。名前はまた、NASAのProject Geminiにも言及しており、DeepMindとGoogle Brainの統合を反映している。

パフォーマンスとベンチマーク

Gemini Ultraは、さまざまな業界ベンチマークで、GPT-4、AnthropicのClaude 2、Inflection AIのInflection-2、MetaのLLaMA 2、xAIのGrok 1を上回ったと報告された。Gemini ProはGPT-3.5を上回ったとされた。特に、Gemini Ultraは、57科目のMassive Multitask Language Understanding(MMLU)テストで人間の専門家を上回った最初の言語モデルであり、90%のスコアを達成した。このベンチマーク結果は、GeminiをArtificial intelligenceLarge language modelの研究分野でリーディングモデルとして位置づけた。

Gemini Proは、2023年12月13日にAI StudioとVertex AIでGoogle Cloudの顧客に利用可能になった。Gemini Nanoは後にAndroid開発者に利用可能になった。ハサビスはさらに、DeepMindがGeminiをロボット工学と組み合わせて物理的に世界と相互作用させる方法を探求していることを明らかにした。2023年10月に米国大統領ジョー・バイデンが署名した大統領令に従い、GoogleはGemini Ultraのテスト結果を連邦政府と共有すると述べた。同様に、同社は2023年11月のBletchley ParkでのAI安全サミットで定められた原則に準拠するために英国政府と協議を行った。

Google製品との統合

発売後、GeminiはGoogleのエコシステム全体に急速に統合された。2024年1月、GoogleはSamsungと提携し、Gemini NanoとGemini ProをGalaxy S24スマートフォンラインアップに統合した。翌月、BardとDuet AIはGeminiブランドの下で統一され、「Gemini Advanced with Ultra 1.0」がGoogle Oneサブスクリプションサービスの新しい「AI Premium」ティアを通じてリリースされた。Gemini Proもグローバルに展開され、当初の英語のみの利用可能性を超えて拡大した。

2024年2月、GoogleはGemini 1.5を発表し、1.0 Ultraよりも強力で有能であると説明した。変更には、新しいアーキテクチャ、mixture-of-expertsアプローチ、より大きな100万トークンのコンテキストウィンドウが含まれていた。同じ月、Googleはより小型で無料のオープンソースのGeminiモデル範囲であるGemmaをデビューさせた。複数の出版物がこれを、Metaや他の企業がAIモデルをオープンソース化していることへの対応であり、GoogleがAIをプロプライエタリに保つ以前の慣行からの転換であると説明した。

Googleは2024年5月14日のI/O基調講演で、追加モデルであるGemini 1.5 Flashを発表した。同じイベントで、Googleはデスクトップ最適化されたGemini Nanoのビルドを「Built-in AI」アーキテクチャを介してGoogle Chromeブラウザに直接統合する計画を発表し、Prompt API(「window.ai」)などの実験的なAPIを通じてウェブ開発者にローカル処理機能を公開した。

その後のアップデートとモデル

更新された2つのGeminiモデル、Gemini-1.5-Pro-002とGemini-1.5-Flash-002が、2024年9月24日にリリースされた。2024年12月11日、Googleは新しいGemini 2.0 Flash Experimentalモデルを発表した。機能には、リアルタイムのオーディオおよびビデオインタラクションのためのMultimodal Live API、ネイティブ画像生成と制御可能なテキスト読み上げ生成(ウォーターマーク付き)、統合されたGoogle Searchが含まれていた。このイテレーションは、マルチモーダルAI機能の限界を押し広げ続けた。

2025年6月、GoogleはGemini CLIを導入した。これは、Geminiの機能をターミナルに直接もたらすオープンソースのAIエージェントであり、個々の開発者向けに寛大な無料使用制限付きの高度なコーディング、自動化、問題解決機能を提供する。この動きは、開発者へのアクセシビリティとオープンソースツールへのGoogleのコミットメントを強調した。

競争上の位置づけ

Geminiのリリースは、Generative AIの競争環境における重要な出来事だった。GoogleはGeminiをOpenAIAnthropic、および他のAI研究組織のモデルと直接競合させた。モデルのマルチモーダル機能と強力なベンチマークパフォーマンスは、GPT-4や他の主要なLLMの支配に挑戦することを意図していた。Search、Workspace、Androidを含むGoogleの広大な製品エコシステムへのGeminiの統合は、競合他社に対する配布上の利点を提供した。

Geminiの開発はまた、ハードウェアパートナーとのコラボレーションを伴った。SamsungのGalaxy S24との統合はオンデバイスAIの重要性を強調し、GoogleのTPUの使用は大規模モデルの訓練における特殊化されたハードウェアの役割を強調した。競争のダイナミクスはクラウドサービスにも及び、Gemini ProはGoogle CloudのVertex AIで利用可能であり、Amazon Web ServicesMicrosoft Azureの提供物と競合した。

技術アーキテクチャと研究

Geminiのアーキテクチャは、Deep learningTransformer (architecture)モデルの進歩に基づいている。マルチモーダルモデルとして、Multi-Head AttentionCross-Attentionの技術を組み込んで、異なるモダリティ間で情報を処理し関連付ける。Gemini 1.5のmixture-of-expertsアプローチは、より効率的なスケーリングを可能にし、与えられたタスクに対してネットワークの関連部分のみを活性化する。モデルの訓練は、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)やCurriculum Learningなどの技術を関与させた可能性があり、パフォーマンスとアライメントを改善する。

Geminiの背後にある研究は、Machine learningの広い分野から引き出されており、MIT CSAILStanford AI LabBAIR (Berkeley AI Research)などの機関からの貢献を含む。Google DeepMindの遺産、特にAlphaGoプログラムは、モデルの設計に情報を与え、特に複雑な多段階推論タスクを処理する能力に影響を与えた。開発には、デミス・ハサビスやAIコミュニティの他の主要人物などの研究者も関与した。

安全性とガバナンス

GoogleはGeminiの安全性テストを強調し、広範な評価を実施するために広く利用可能にするのを遅らせた。同社は、2023年10月のAIに関する大統領令に続いて、テスト結果を米国連邦政府と共有することを約束した。英国政府との協議は、Bletchley ParkでのAI安全サミットの原則に合わせることを目的としていた。これらのステップは、Artificial intelligenceに対する規制上の監視の高まりと、強力なモデルの責任ある展開の必要性を反映していた。

GeminiのPixel 8 ProやGalaxy S24などの消費者製品への統合は、プライバシーとオンデバイス処理に関する疑問を提起した。Gemini Nanoのローカル処理機能は、データ送信を最小限に抑えるように設計されており、いくつかのプライバシー懸念に対処している。しかし、マルチモーダルAIの広範な展開は、倫理的な使用と潜在的な社会的影響についての議論を引き続き促している。

将来の方向性

2025年現在、Geminiは新しいモデルと機能で進化し続けている。Gemini CLIとオープンソースのGemmaモデルの導入は、AI機能へのアクセスを広げる戦略を示している。Google DeepMindへのGoogleの継続的な投資とGoogle Cloudとの統合は、Geminiが同社のAI戦略の中心的な柱であり続けることを示唆している。将来の開発には、推論のさらなる改善、より効率的なアーキテクチャ、そしてハサビスがGeminiとロボット工学の組み合わせについて語ったことに示唆されるように、ロボット工学や物理システムとのより深い統合が含まれる可能性がある。

競争環境は依然としてダイナミックであり、OpenAIAnthropicが高度なモデルをリリースし続けている。Geminiの成功は、パフォーマンスのリーダーシップを維持し、マルチモーダル機能を拡張し、複雑な規制と倫理的なAIの状況をナビゲートする能力に依存するだろう。ふたご座の二面性を呼び起こすモデルの名前は、多様なAI機能を単一の強力なシステムに統合するというプロジェクトの野心を適切に捉えている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·google·large-language-model·multimodal-ai
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴