Gemini 1 リリース

英語からの翻訳

Gemini 1は、Google DeepMindの初代マルチモーダル大規模言語モデルファミリーであり、2023年12月6日に発表され、LaMDAとPaLM 2の後継となった。Ultra、Pro、Nanoの3つのモデルを導入し、Geminiチャットボットを支え、生成AIにおける大きな一歩を示した。

Gemini 1は、大規模言語モデルのファミリーであり、Google DeepMindによって開発され、2023年12月6日にLaMDAとPaLM 2の後継として発表されました。このファミリーは、高度に複雑なタスク向けに設計されたGemini Ultra、幅広いタスク向けのGemini Pro、およびオンデバイスタスク向けのGemini Nanoの3つの初期モデルで構成されています。このファミリーはGeminiチャットボットを支え、その名はGemini星座にちなんで付けられ、Google BrainとDeepMindの合併を反映しています。テキストのみの前身モデルとは異なり、Geminiはテキスト、画像、音声、動画、そしてコンピューターコードを同時に処理するよう訓練されており、OpenAIのGPT-4やその他の生成AIシステムに対する直接の競争相手として位置付けられています。

このリリースは人工知能開発における極めて重要な瞬間となりました。Gemini Ultraは、57科目にわたる大規模マルチタスク言語理解(MMLU)テストで初めて人間の専門家を上回るパフォーマンスを発揮し、90%のスコアを達成しました。Googleはこれを「最大かつ最も高性能なAIモデル」と謳い、その機能は機械学習深層学習、そしてニューラルネットワークのアーキテクチャに敷衍しています。

開発の背景

Googleは2023年5月10日のGoogle I/O基調講演で最初にGeminiを発表し、CEOのサンダー・ピチャイ氏はまだ初期開発段階にあると述べました。これはDeepMindとGoogle Brainの協力により構築され、両者はGoogle DeepMindの傘下で統合されました。DeepMindのCEOであるデミス・ハサビス氏はインタビューで、Geminiが会話型テキスト機能とAIによる画像生成を組み合わせ、2016年に世界中の注目を集めたDeepMindのAlphaGoの強みを活用することになると強調しました。

開発には数百人のエンジニアが関わり、Googleの共同創業者であるサーゲイ・ブリン氏が退職から復帰して支援し、後に「中心的な貢献者」と称されました。このモデルはYouTube動画のトランスクリプトで訓練され、弁護士が潜在的に著作権で保護された素材をフィルタリングしました。2023年8月までに、2023年末のローンチを目指すとの報告があり、Google CloudのVertex AIサービスを通じて厳選された企業に早期アクセスが与えられました。

ローンチと初期モデル

2023年12月6日、ピンチャイ氏とハサビス氏はバーチャル記者会見で「Gemini 1.0」を発表しました。発売当初、Gemini ProとNanoはそれぞれBardとPixel 8 Proスマートフォンに搭載され、Gemini Ultraは「Bard Advanced」と開発者向けアクセスが2024年初頭に予定されました。当初モデルは英語のみで利用可能であり、Googleは広範なリリース前に「徹底的な安全性テスト」の必要性を理由として挙げていました。

はGoogleのTensor Processing Units(TPU)で訓練されました。Gemini Ultraは業界検証ベンチマークでGPT-4、Anthropicのクロード 2、Inflection AIのInflection-2、MetaのLLaMA 2、およびxAIのGrok 1を上回ったと報告され、Gemini ProはGPT-3.5を上回りました。Gemini 2023年10月の米国大統領令に従い、Googleはテスト結果を連邦政府と共有り、英国政府とはブレッチリー・パークサミットによるAI安全原則についても関与りました。

技術的アーキテクチャと機能

Geminiのアーキテクチャはトランスフォーマーモデルを活用し、マルチヘッドアテンション位置エンコーディングメカニズムを組み込みました。そのマルチモーダル設計により、多様なデータタイプを同時に処理でき、テキスト専用LLMからの各種分離が可能でした。このモデルは、AIフィードバックからの強化学習温度スケーリングなどの技術を統合し、生成多様性のためにはトップkサンプリングトップpサンプリングを採用しました。

モデルの訓練では、Adamオプティマイザの変種、学習率スケジュール、そして勾配クリッピングを使用して深層学習のプロセスをを安定化しました。バッチ正規化ドロップアウトは一般化を向上させ、モデルプルーニングはGemini Nanoのオンデバイス展開のための効率化に貢献しました。

アップデートと拡大

2024年1月、GoogleはSamsungと提携して、Galaxy S24スマートフォンシリーズにGeminiをNanoとProを統合しました。翌月、BardとDuet AIは前でGeminiブランド、新合わせされ、Google Oneの新レベルより「Gemini Advanced with Ultra 1.0」でリリースされました。Gemini Pro はグローバル提供が開始されました。

2024年2月、GoogleはGemini 1.5を発表し、新着アーキテクチャ・エクスパート方式、そして一万トークン相当の文脈ウィンドウを特徴にしました。同年同月、Googleはより小規模で無料・オープンソースのGeminiモデル群であるGemmaを公開し、これはMetaのオープンソース化手法への対応と表現されました。Gemini 1.5 Flashは2024年5月14日のI/O基調基で発表され、Gemini NanoをChromeブラウザに統合する計画が「Built-in AI」アーキテクチャなどを通じて発表されました。更新モデル、Gemini-1.5-Pro-002とGemini-1.5-Flash-002、が2024年12月24日にリリースされました。

影響と遺産

Gemini 1は、生成AIの分野におけるGoogle Deep=ninを先導的存在に、OpenAIと直接的に競争しました。そのマルチモーダルアプローチは、業界のその後のモデル開発に波及し、Amazon Web Servicesや[[azure|Microsoft

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:google-deepmind·large-language-model·generative-ai·ai-release
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴