Google Geminiは、以前はBardとして知られていた、Googleが開発した生成人工知能チャットボットおよび仮想アシスタントです。以前はLaMDAとPaLM 2に基づいていましたが、現在は同名の大規模言語モデル(LLM)ファミリーによって駆動されています。Geminiアーキテクチャは、複数のデータタイプに対してネイティブにトレーニングされており、モデルがテキスト、コンピュータコード、画像、音声、動画を同時に処理および生成できるようにしています。Googleは、効率的なオンデバイス版(「Nano」)や費用対効果の高い高スループット版(「Flash」)から、複雑な推論用に設計された高計算モデル(「Pro」および「Ultra」)まで、さまざまな能力でこの技術を配布しています。1.5および3モデル世代では、拡張コンテキストウィンドウが導入され、コードベース全体、長編動画、広範なドキュメントアーカイブなどの大規模データセットを単一のプロンプトで分析できるようになりました。
Geminiは2023年12月6日に初めて発表され、AIサービスに関する既存のGoogleブランドを置き換えました。2024年2月には、BardチャットボットがGeminiに改名され、Google CloudおよびWorkspaceの「Duet AI」ブランドはGemini識別子を優先して廃止されました。これらのモデルは、Androidデバイスでオーバーレイアシスタントとして機能するGeminiモバイルアプリ、およびサードパーティ開発者向けのVertex AIプラットフォームを通じて、Googleエコシステムに統合されています。
歴史
背景
2022年11月、OpenAIはGPT-3大規模言語モデルファミリーに基づくチャットボットであるChatGPTを発表しました。ChatGPTは世界的な注目を集め、バイラルなインターネット現象となりました。ChatGPTがGoogle検索に対する潜在的な脅威であると alarm されたGoogle幹部は「コードレッド」警報を発令し、複数のチームを会社の人工知能活動を支援するために再配置しました。Googleおよび親会社AlphabetのCEOであるSundar Pichaiがこの警報を発令したと広く報じられましたが、Pichaiは後にこれをThe New York Timesに否定しました。異例の動きとして、2019年にAlphabetの共同CEOの役職を退いていたGoogle共同創業者のLarry PageとSergey Brinは、ChatGPTへの対応を議論するために会社幹部との緊急会議に出席しました。Brinは2023年2月に、数年ぶりにGoogleのコードへのアクセスを要求しました。
Googleは2021年にプロトタイプのLLMであるLaMDAを発表していましたが、一般公開はされませんでした。全社員会議で従業員からLaMDAがChatGPTと競争する機会を逃したのかと尋ねられた際、PichaiとGoogle AI責任者のJeff Deanは、同社のチャットボットにはChatGPTと同様の能力があるものの、誤った情報を広める可能性のあるLLMを導入するリスクがあるため、待つことを決定したと述べました。2023年1月、Google Brainの姉妹会社DeepMindのCEOであるDemis HassabisはChatGPTのライバルの計画を示唆し、Google従業員はChatGPT競争相手の進捗を加速するよう指示され、「Apprentice Bard」や他のチャットボットを集中的にテストしました。Pichaiは2月の四半期決算投資家電話会議で、同社にはLaMDAの利用可能性とアプリケーションを拡大する計画があると投資家に保証しました。
Bard
#### 発表
2023年2月6日、GoogleはLaMDAによって駆動される生成人工知能チャットボットであるBardを発表しました。Bardは最初に10,000人の「信頼できるテスター」の選抜グループに展開され、その後月末に広範なリリースが予定されていました。このプロジェクトは製品リードのJack Krawczykが監督し、彼はこの製品を検索エンジンではなく「協調的AIサービス」と説明しました。一方、PichaiはBardがGoogle検索にどのように統合されるかを詳述しました。Reutersは、ChatGPTのような機能をGoogle検索に追加すると、2024年までに同社に60億ドルの追加費用がかかる可能性があると計算しました。一方、調査・コンサルティング会社のSemiAnalysisは、Googleに30億ドルの費用がかかると計算しました。この技術はコードネーム「Atlas」の下で開発され、「Bard」という名前はケルト語で語り手を意味する用語に由来し、「アルゴリズムの下にある創造的な性質を反映する」ために選ばれました。
複数のメディアや金融アナリストは、GoogleがBardの発表を「急いだ」と説明しました。これは、ライバルのMicrosoftが2月7日に予定していた、OpenAIとの提携を発表してBing検索エンジンにBing AI(後にMicrosoft Copilotとしてブランド変更)の形でChatGPTを統合するイベントを先取りし、「追いつく」ことを避けるためでした。Microsoft CEOのSatya NadellaはThe Vergeに「彼らに踊らせたかった」と語りました。The VergeのTom WarrenとBloomberg NewsのDavey Albaは、これが2021年に6年間の「休戦」が失効した後、2つの大手テック企業間で「検索の未来」をめぐる別の衝突の始まりを示すと指摘しました。The GuardianのChris Stokel-Walker、RecodeのSara Morrison、投資会社Wedbush SecuritiesのアナリストDan Ivesは、これを両者間のAI軍拡競争と名付けました。
2月8日のパリでの「期待外れ」のライブストリームでBardを披露した後、Googleの株価は8パーセント下落し、これは時価総額で1000億ドルの損失に相当し、ライブストリームのYouTube動画は非公開にされました。多くの視聴者はまた、デモ中にBardがクエリに応答してジェームズ・ウェッブ宇宙望遠鏡について不正確な情報を提供するエラーを指摘しました。Google従業員は、同社の内部フォーラムであるMemegenで、Pichaiの「急いだ」および「しくじった」Bard発表を批判しました。一方、FuturismのMaggie Harrisonはこの展開を「混乱」と呼びました。Pichaiは、Googleが「長い間AIに深く取り組んできた」と述べて自身の行動を擁護し、Bardの発表が反射的な反応であったという考えを否定しました。
パリのライブストリームの1週間後、Pichaiは80,000人の従業員にBardを内部的にテストするために2〜4時間を費やすよう求め、Google幹部のPrabhakar Raghavanは彼らにBardが行ったエラーを修正するよう求めました。その後数週間、Google従業員は内部メッセージでBardを批判し、安全性と倫理上の懸念を挙げ、会社幹部にサービスを開始しないよう求めました。Google幹部は、AI倫理チームが実施した否定的なリスク評価レポートを却下して製品を開始しました。Pichaiが収益成長の鈍化によりその月の後半に突然12,000人の従業員を解雇した後、残った従業員は、解雇についてBardの「意見」を求めるユーモラスなやり取りのミームや抜粋を共有しました。
技術アーキテクチャ
Geminiモデルは、他のLarge language modelと同様にTransformer (architecture)アーキテクチャに基づいて構築されていますが、重要な違いがあります。それは、複数のデータタイプに対してネイティブにトレーニングされていることです。このマルチモーダルトレーニングにより、モデルはテキスト、コード、画像、音声、動画を同時に処理および生成できます。これは、各モダリティを個別に処理していた初期のモデルとは異なります。アーキテクチャには、長いシーケンスを処理するためのMulti-Head AttentionやPositional Encodingなどの技術が組み込まれています。1.5および3世代では、拡張コンテキストウィンドウが導入され、コードベース全体、長編動画、広範なドキュメントアーカイブなどの大規模データセットを単一のプロンプトで分析できるようになりました。これは、計算オーバーヘッドを削減する効率的なアテンションメカニズムを通じて達成されます。
Googleは、パフォーマンスと効率のバランスを取るために、Geminiをいくつかのバリアントで配布しています。「Nano」バリアントはオンデバイス使用向けに設計されており、モバイルハードウェア上で効率的に動作します。「Flash」バリアントは高スループットで費用対効果の高いタスク向けに最適化されています。「Pro」バリアントは複雑な推論を処理し、「Ultra」バリアントは最も要求の厳しいアプリケーション向けの最高計算モデルです。これらのバリアントは、Vertex AIを介してGoogleのGoogle Cloudプラットフォームに統合されており、サードパーティ開発者がAPIを通じてモデルにアクセスできるようにしています。
統合と利用可能性
Geminiモバイルアプリは、Androidデバイスでオーバーレイアシスタントとして機能し、一部の機能で以前のGoogle Assistantを置き換えています。これは、Geminiブランドの下で、Gmail、Docs、Sheetsを含むGoogle Workspaceに統合されています。モデルはまた、開発者がAIアプリケーションを構築および展開するためのツールを提供するGoogle CloudのVertex AIプラットフォームを通じて利用可能です。2024年2月、BardチャットボットはGeminiに改名され、Google CloudおよびWorkspaceの「Duet AI」ブランドはGemini識別子を優先して廃止されました。このブランド変更により、GoogleのAI製品は単一の名前の下で統一されました。
評価と論争
Geminiのリリースは、技術的な賞賛と一般の論争の両方を生み出しました。コメンテーターは、コーディングおよび検索タスクにおけるモデルのベンチマークがOpenAIのGPT-4およびGPT-5と競争力があることを強調しています。しかし、製品発表はその出力の信頼性に関する批判に直面しました。2024年初頭、Googleは、ユーザーが人間の被写体の描写における歴史的不正確さとバイアスを報告した後、モデルの人物画像生成機能を一時停止しました。2025年を通じてリリースされたGemini 1.5および3シリーズを含むその後のアップデートは、幻覚の削減、レイテンシーの改善、および自律的な研究とソフトウェア開発のためのエージェント能力の強化に焦点を当てました。これらの論争は、バイアスと事実の正確性に関するGenerative AIにおける継続的な課題を浮き彫りにしています。