Geminiは、Googleの子会社であるGoogle DeepMindによって開発された、マルチモーダル大規模言語モデル(LLM)のファミリーである。これは、Googleの初期のモデルであるLaMDAやPaLM 2の後継として機能する。Geminiファミリーには、Gemini Pro、Gemini Deep Think、Gemini Flash、Gemini Flash Liteなどの複数のバリエーションが含まれ、Geminiチャットボットを支えている。Geminiという名前は、双子座を指すとともに、Google BrainとDeepMindの合併や、NASAのジェミニ計画にも言及している。2023年12月6日に発表されたGeminiは、テキスト、画像、音声、動画、コンピューターコードなど、複数のデータタイプを同時に処理できるように設計されており、多くのテキストのみの前身モデルとは一線を画している。
Geminiの開発は、生成AI分野、特にOpenAIのGPT-4や他の大規模言語モデルに対抗するGoogleの取り組みにおける重要な一歩となった。GoogleはGeminiを「最大かつ最も高性能なAIモデル」と位置づけ、その能力はテキスト生成を超えて、画像理解や生成、ロボット工学との統合の可能性にまで及ぶ。このモデルはGoogleのTensor Processing Units(TPU)でトレーニングされ、当初は英語のみで利用可能であり、Googleの製品やサービス全体に段階的に展開された。
開発
Googleは2023年5月10日のGoogle I/O基調講演で初めてGeminiを発表し、CEOのサンダー・ピチャイは、同じイベントで発表されたPaLM 2のより強力な後継モデルであると説明した。当時、Geminiはまだ初期開発段階にあったが、既にそのマルチモーダル設計で注目されており、これは主にテキストコーパスに依存する既存のLLMの多くとは異なる点だった。このモデルは、2023年4月にGoogle DeepMindに統合された2つのAI研究グループ、DeepMindとGoogle Brainの協力により開発された。
DeepMindのCEOであるデミス・ハサビスは、WiredのインタビューでGeminiの可能性を強調し、GPT-4で動作するOpenAIのChatGPTを凌駕する可能性があると示唆した。ハサビスは、2016年に囲碁チャンピオンのイ・セドルを破ったプログラムであるAlphaGoでのDeepMindの経験を引き合いに出し、GeminiはAlphaGoの強みと他のGoogle-DeepMind LLMを組み合わせるものだと述べた。2023年8月、The Informationは、Googleが2023年末までにGeminiを立ち上げることを目指しており、会話型テキスト機能とAI駆動の画像生成を統合し、文脈に応じた画像作成やより広範なユースケースを可能にする計画があると報じた。
Googleの共同創業者であるサーゲイ・ブリンは、Geminiの開発を支援するために引退から復帰し、Google BrainとDeepMindの数百人のエンジニアと共に作業した。ブリンは後にこのプロジェクトの「中核的貢献者」としてクレジットされた。GeminiがYouTube動画のトランスクリプトでトレーニングされたため、Googleは潜在的な著作権侵害コンテンツをフィルタリングするために弁護士を関与させた。開発プロセスには広範な安全性テストも含まれており、Googleは責任ある展開を確実にするため、Geminiは2024年まで広くリリースされないと述べた。
Geminiの差し迫った発売に対応して、OpenAIはGPT-4へのマルチモーダル機能の統合作業を加速させた。2023年9月までに、いくつかの企業がGeminiの初期バージョンへの早期アクセスを許可され、GoogleはこれをGoogle CloudのVertex AIサービスを通じて提供する計画だった。このモデルはまた、コーディングアシスタント分野でMicrosoftのGitHub Copilotと競合するように位置づけられた。
発売
2023年12月6日、サンダー・ピチャイとデミス・ハサビスはオンライン記者会見で「Gemini 1.0」を発表した。初期リリースには3つのモデルが含まれていた。Gemini Ultraは「非常に複雑なタスク」向け、Gemini Proは「幅広いタスク」向け、Gemini Nanoは「デバイス上のタスク」向けに設計された。発売時点で、Gemini ProとNanoはそれぞれBard(Googleのチャットボット)とPixel 8 Proスマートフォンに統合された。Gemini Ultraは「Bard Advanced」を支え、2024年初頭に開発者向けに利用可能になる予定だった。Googleはまた、GeminiをSearch、Ads、Chrome、Google WorkspaceのDuet AI、AlphaCode 2に組み込む計画を立てていた。
Geminiは当初、英語のみで利用可能だった。Googleはこれを「最大かつ最も高性能なAIモデル」と宣伝し、人間の行動を模倣するように設計されたと述べた。同社は、「広範な安全性テスト」の必要性のため、Geminiは翌年まで広く利用可能にならないことを強調した。GeminiはGoogleのTPUでトレーニングされ、それを動力源としており、その名前はDeepMindとGoogle Brainの合併やNASAのジェミニ計画に言及していた。
Gemini Ultraは、さまざまな業界ベンチマークで、GPT-4、AnthropicのClaude 2、Inflection AIのInflection-2、MetaのLLaMA 2、xAIのGrok 1を含む複数の競合モデルを上回ったと報告された。Gemini ProはGPT-3.5を上回るとされた。特に、Gemini Ultraは、57科目のMassive Multitask Language Understanding(MMLU)テストで人間の専門家を上回った最初の言語モデルとなり、90%のスコアを達成した。Gemini Proは2023年12月13日にAI StudioとVertex AIでGoogle Cloudの顧客に利用可能になり、Gemini Nanoは後にAndroid開発者向けに利用可能になった。
ハサビスはまた、DeepMindがGeminiをロボット工学と組み合わせて、世界との物理的な相互作用を可能にする方法を模索していることを明らかにした。2023年10月にジョー・バイデン大統領が署名した米国の大統領令に沿って、GoogleはGemini Ultraのテスト結果を米国連邦政府と共有すると述べた。同様に、Googleは英国政府と連携し、2023年11月のブレッチリー・パークでのAI安全サミットの原則に沿うようにした。
2025年6月、GoogleはGemini CLIを導入した。これはオープンソースのAIエージェントで、Geminiの機能をターミナルにもたらし、コーディング、自動化、問題解決機能を提供し、個人開発者向けに寛大な無料利用制限を備えている。
アップデート
2024年1月、GoogleはSamsungと提携し、Gemini NanoとGemini ProをGalaxy S24スマートフォンシリーズに統合した。翌月、BardとDuet AIはGeminiブランドの下で統一され、「Gemini Advanced with Ultra 1.0」がGoogle Oneサブスクリプションサービスの新しい「AI Premium」ティアを通じてリリースされた。Gemini Proもグローバルに展開された。
2024年2月、GoogleはGemini 1.5を発表し、1.0 Ultraよりも強力で高性能であると説明した。変更点には、新しいアーキテクチャ、混合専門家アプローチ、より大きな100万トークンのコンテキストウィンドウが含まれていた。同月、GoogleはGemmaを発表した。これは、より小さく、無料で、オープンソースのGeminiモデルの範囲である。複数の出版物がこれを、MetaなどがAIモデルをオープンソース化することへの対応であり、GoogleがこれまでAIを独自技術として保持してきた慣行からの転換であると説明した。
Googleは2024年5月14日のGoogle I/O基調講演で、追加モデルであるGemini 1.5 Flashを発表した。同じイベントで、Googleはデスクトップ最適化版のGemini Nanoを「Built-in AI」アーキテクチャを通じてGoogle Chromeブラウザに直接統合する計画を発表し、Prompt API(「window.ai」)などの実験的APIを通じて、ローカル処理機能をウェブ開発者に公開した。
2つの更新されたGeminiモデル、Gemini-1.5-Pro-002とGemini-1.5-Flash-002が2024年9月24日にリリースされた。
2024年12月11日、Googleは新しいGemini 2.0 Flash Experimentalモデルを発表した。機能には、リアルタイムの音声およびビデオ対話のためのMultimodal Live API、ネイティブ画像生成と制御可能なテキスト読み上げ生成(ウォーターマーク付き)、統合されたGoogle Searchが含まれる。また、推論とコーディング機能の改善も導入された。
アーキテクチャとトレーニング
Geminiは、多くの現代の大規模言語モデルの基盤であるトランスフォーマーアーキテクチャに基づいて構築されている。このモデルは後のバージョンで混合専門家アプローチを採用しており、各タスクに関連するサブネットワークのみをアクティブ化することで効率的にスケールできる。トレーニングには、テキスト、画像、音声、動画、コードを含む大規模なデータセットが使用され、YouTubeトランスクリプトを含むさまざまなリポジトリから取得され、著作権遵守のために慎重なフィルタリングが必要だった。
このモデルは、カスタムの人工知能アクセラレータであるGoogleのTPUでトレーニングされた。このインフラストラクチャにより、Geminiは大規模なトレーニング実行を処理でき、MMLUなどのベンチマークでのパフォーマンスに貢献した。マルチモーダルトレーニングアプローチにより、Geminiは異なるモダリティ間でコンテンツを処理および生成でき、テキスト生成から画像理解まで、さまざまなアプリケーションに versatile である。
機能とパフォーマンス
Geminiの機能は複数の領域に及ぶ。複雑な推論タスクを実行し、コードを生成し、画像を理解および生成し、音声と動画を処理できる。業界ベンチマークでのモデルのパフォーマンスは主要なセールスポイントとなっている。Gemini UltraのMMLUでの90%のスコアは、人間の専門家を上回り、57科目にわたる広範な知識を強調する注目すべき成果だった。
ベンチマークに加えて、GeminiはSearch、Ads、Chromeを含むさまざまなGoogle製品に統合され、AI駆動機能を強化している。Gemini 1.5で最大100万トークンまで処理できる長いコンテキストウィンドウを処理するモデルの能力により、大きなドキュメントやコードベース全体を処理でき、開発者や研究者にとって有用である。
統合とエコシステム
Geminiは、Google CloudやVertex AIを含むGoogleのクラウドサービスに統合されており、企業がその機能にアクセスできる。また、2024年2月にBardからブランド変更されたGeminiチャットボットも支えている。Gemini Nanoを介したAndroidデバイスでのモデルの利用可能性により、オンデバイスAI処理が可能になり、プライバシーとレイテンシーに敏感なアプリケーションにとって重要である。
Googleはまた、Samsung ElectronicsとのGalaxy S24向けの提携や、より小さくアクセスしやすいモデルであるGemmaなどのオープンソースリリースを通じて、Geminiを利用可能にしている。2025年に導入されたGemini CLIは、開発者向けのコマンドラインインターフェースを提供し、エコシステムをさらに拡大している。
評価と影響
Geminiは、そのマルチモーダル機能と強力なベンチマークパフォーマンスにより、AIコミュニティで好意的に受け入れられている。しかし、安全性、著作権問題、大規模モデルのトレーニングの環境影響に関しても scrutinized されている。Googleがテスト結果を政府と共有する決定は、AI規制と安全性に関するより広範な懸念を反映している。
Geminiの発表はAI業界の競争を激化させ、OpenAIやAnthropicなどの競合他社に自社の開発を加速させるよう促した。GeminiのGoogle製品への統合は、市場支配力とAI展開の倫理的影響についての疑問も提起している。
今後の方向性
GoogleはGeminiの反復を続けており、Gemini 2.0 Flash Experimentalなどのアップデートは、リアルタイムの相互作用とマルチモーダル生成への焦点を示している。ロボット工学統合の探求は、物理AIシステムでの潜在的な応用を示唆している。2025年現在、Geminiはさらに進化すると予想され、推論、効率性、安全性の改善に関する継続的な研究が行われている。
Geminiの開発はまた、生成AIのより広範なトレンドと一致しており、モデルはよりマルチモーダルになり、複雑なタスクを処理できるようになっている。TPUへのGoogleの投資と、カスタムチップのためのBroadcomとの提携は、AIインフラストラクチャの進歩へのコミットメントを強調している。