2024年2月のGoogle Gemini Ultraのローンチは、Google DeepMindによって開発されたGeminiファミリーのマルチモーダル大規模言語モデルの中で、最大かつ最も高性能なモデルであるGemini Ultra 1.0の一般公開を示すものでした。このローンチは、2023年12月6日のGemini 1.0の初期発表に続くものであり、新しいサブスクリプション層を通じて消費者にモデルを提供し、OpenAIのGPT-4などの他の高度なAIシステムに対する直接の競争相手として位置づけられました。
Gemini Ultra 1.0は、非常に複雑なタスク向けに設計されており、Geminiファミリーの他のモデル(Gemini ProやGemini Nanoなど)とは一線を画していました。これは、GoogleのAIチャットボットのプレミアム版であるBard Advancedに統合され、またGoogle Oneサブスクリプションサービスの「AI Premium」層を通じても提供されました。このローンチは、Googleが最も先進的なAI技術を商業化し、急速に進化する生成AI市場で競争するための取り組みにおける重要な一歩を表しました。
背景と開発
Geminiの開発は、2023年4月に統合されてGoogle DeepMindを形成したGoogle BrainとDeepMindの間の協力として始まりました。2023年5月10日のGoogle I/O基調講演で発表されたGeminiは、PaLM 2の後継として位置づけられ、マルチモダリティ(テキスト、画像、音声、動画、コンピュータコードを同時に処理する能力)に焦点を当てていました。GoogleのCEOであるサンダー・ピチャイとDeepMindのCEOであるデミス・ハサビスがプロジェクトを主導し、共同創業者のセルゲイ・ブリンが「中核的な貢献者」として参加したと報告されています。
開発中、GoogleはGPT-4やAnthropicのClaude 2などの既存モデルを超えることを目指しました。このモデルは、GoogleのTensor Processing Units(TPU)でトレーニングされ、DeepMindのAlphaGoプログラムからの技術を組み込みました。2023年8月までに、Googleが2023年末のローンチを目標としているとの報告があり、一部の企業にはGoogle CloudのVertex AIサービスを通じて早期アクセスが許可されました。
発表と初期リリース
2023年12月6日、ピチャイとハサビスは仮想記者会見でGemini 1.0を発表しました。このリリースには、「非常に複雑なタスク」向けのGemini Ultra、「幅広いタスク」向けのGemini Pro、「デバイス上のタスク」向けのGemini Nanoの3つのモデルが含まれていました。ローンチ時には、Gemini ProとNanoはそれぞれBardとPixel 8 Proスマートフォンに統合され、Gemini Ultraは2024年初頭にBard Advancedを通じて利用可能になる予定でした。
Gemini Ultraは、Googleの「最大かつ最も高性能なAIモデル」として宣伝され、57科目のMassive Multitask Language Understanding(MMLU)テストで人間の専門家を上回った最初のモデルであり、90%のスコアを達成しました。また、さまざまなベンチマークでGPT-4、Claude 2、Inflection-2、LLaMA 2、Grok 1を上回りました。広範な安全性テストの要件のため、このモデルは翌年まで広く利用可能にはなりませんでした。
2024年2月のローンチ
2024年2月、GoogleはGemini Ultra 1.0を「Gemini Advanced」体験の一部としてローンチし、Google One AI Premiumサブスクリプション層を通じて提供しました。このローンチでは、BardとDuet AIがGeminiブランドの下で統合され、Bard AdvancedがGemini Advancedになりました。このモデルは英語でユーザーに利用可能になり、サブスクリプション費用はプレミアムオファリングとして位置づけられました。
このローンチには、Gemini Proのグローバル展開が伴い、より多くの地域でモデルへのアクセスが拡大されました。Googleはまた、Search、Ads、Chrome、Google Workspaceを含む他の製品へのGeminiの統合を開始し、エコシステム全体にAIを組み込むというより広範な戦略を示しました。
技術的な能力とアーキテクチャ
Gemini Ultra 1.0は、他の大規模言語モデルと同様のトランスフォーマーアーキテクチャに基づいて構築されましたが、マルチモーダル処理のための強化が施されていました。テキスト、画像、音声、動画、コードを処理でき、自然言語理解からコード生成までのアプリケーションに多用途に対応しました。このモデルは、YouTube動画のトランスクリプトを含む大規模なデータセットでトレーニングされ、法的チームが著作権で保護された素材をフィルタリングしました。
注目すべき機能の1つは、文脈に応じた画像を生成する能力であり、これはテキストのみのモデルとは一線を画すものでした。これは、AI駆動の画像生成との統合を通じて達成され、モデルがテキストプロンプトに基づいて視覚コンテンツを作成できるようにしました。このモデルはまた、深層学習とニューラルネットワークからの技術を活用して、推論と問題解決タスクで強力なパフォーマンスを示しました。
統合とパートナーシップ
ローンチ後、GoogleはSamsungと提携し、2024年1月にGalaxy S24スマートフォンラインナップにGemini NanoとProを統合しました。これは、要約や翻訳などのタスクのためのオンデバイス処理を備え、高度なAIをモバイルデバイスに導入する上での重要な一歩を示しました。
エンタープライズ分野では、Gemini UltraはGoogle CloudのVertex AIとAI Studioを通じて開発者に利用可能になり、企業がカスタムアプリケーションを構築できるようになりました。このモデルはまた、GoogleのDuet AI for Workspaceに統合され、AI駆動の支援で生産性ツールを強化しました。
受け止めと影響
Gemini Ultra 1.0のローンチは、AIコミュニティで大きな注目を集め、高度なAI能力をめぐる競争における主要なマイルストーンを表しました。MMLUなどのベンチマークでのパフォーマンスは新しい基準を設定し、そのマルチモーダル機能はより人間らしいAIへの一歩と見なされました。
しかし、一部の批評家は、モデルの利用可能性が限られており、サブスクリプションベースのアクセスが一部のユーザーにとって障壁と見なされると指摘しました。それにもかかわらず、このローンチは、OpenAIや他のプレイヤーと直接競争する人工知能のリーダーとしてのGoogleの地位を固めました。
その後の展開
ローンチ後の数か月で、GoogleはGeminiファミリーの反復を続けました。2024年2月、同社はGemini 1.5を導入し、混合専門家アーキテクチャとより大きな100万トークンのコンテキストウィンドウを特徴としました。その年の後半、Googleは更新版であるGemini-1.5-Pro-002とGemini-1.5-Flash-002をリリースし、2024年12月にはGemini 2.0 Flash Experimentalを発表しました。
これらの更新は、AIの急速な進歩に対するGoogleのコミットメントを示し、各反復でパフォーマンス、効率、能力の改善がもたらされました。したがって、Gemini Ultraのローンチは、GoogleのAIオファリングにおける新時代の始まりを示し、この分野での将来の革新の舞台を設定しました。