Google Gemini 3 マルチモーダル版の発表

英語からの翻訳

2025年11月にGoogle DeepMindが発表したGemini 3は、テキスト、画像、ビデオ、音声を同時に処理するネイティブなマルチモーダル大規模言語モデルであり、Gemini 2.0の後継としてGeminiチャットボットを支えている。

Gemini 3は、Google DeepMindによって開発されたマルチモーダル大規模言語モデル(LLM)のファミリーであり、2025年11月にGemini 2.0の後継として発表された。ネイティブにマルチモーダルであり、テキスト、画像、動画、音声を、各モダリティに別々のコンポーネントを用いるのではなく、ゼロから同時に処理する。このモデルはGeminiチャットボットを駆動し、2023年12月のオリジナルのGemini 1.0リリースで確立された命名規則に従い、ふたご座にちなんで名付けられた。

この発表により、Gemini 3はOpenAIAnthropicのモデルに対する直接の競合製品として位置づけられ、Googleはその統一アーキテクチャを重要な差別化要因として強調した。補助モジュールを通じてマルチモーダル機能を統合していた初期バージョンとは異なり、Gemini 3はすべてのデータタイプに対してエンドツーエンドでトレーニングされ、単一のパスでモダリティをまたいで推論できる。この設計は、2023年にDeepMindとGoogle Brainを統合して開発を加速させたGoogle DeepMindの基礎的な研究に基づいている。

開発の背景

Gemini 3の開発は、2023年5月10日にCEOのサンダー・ピチャイによってGoogle I/Oで初めて発表されたオリジナルのGeminiプロジェクトにまで遡る。初期モデルであるGemini 1.0は2023年12月6日に、複雑なタスク用のUltra、一般的な用途向けのPro、デバイス上での処理用のNanoという3つのバリエーションで発売された。これはGoogleのTensor Processing Units(TPU)でトレーニングされ、2016年に囲碁チャンピオンのイ・セドルを破ったDeepMindのAlphaGoプログラムからの教訓が組み込まれた。

その後の反復によりアーキテクチャは洗練された。2024年2月にリリースされたGemini 1.5は、混合専門家(mixture-of-experts)アプローチと100万トークンのコンテキストウィンドウを導入した。2024年12月11日に発表されたGemini 2.0 Flash Experimentalは、リアルタイムの音声・動画インタラクションのためのMultimodal Live APIを追加した。Gemini 3はこれらの進歩を基盤としており、2025年11月のリリースでは、ネイティブなマルチモーダリティをアドオンではなく中核機能として重視している。

開発チームにはGoogle BrainとDeepMindからの数百人のエンジニアが含まれ、共同創業者のセルゲイ・ブリンも以前のバージョンと同様に中核的な貢献者として参加した。トレーニングデータにはYouTube動画の書き起こしが含まれ、法的チームが潜在的に著作権で保護された素材をフィルタリングした。この慣行はGemini 3でも継続された。

ネイティブなマルチモーダルアーキテクチャ

Gemini 3の特徴は、そのネイティブなマルチモーダル設計であり、テキスト、画像、動画、音声を統一されたトランスフォーマーアーキテクチャを通じて処理する。これは、モダリティを別々のエンコーダーとデコーダーで処理していたGemini 1.0のような初期モデルとは対照的である。この統一アプローチにより、モデルは中間変換ステップなしでモダリティ間の情報を関連付けることができ、同期された音声と視覚的推論を伴う動画理解などのタスクが改善される。

このアーキテクチャは、複数の入力ストリームを処理するように拡張されたマルチヘッドアテンションメカニズムを活用している。位置エンコーディングは時間的および空間的次元に適用され、モデルが動画フレーム全体でオブジェクトを追跡し、音声を対応する視覚情報と整合させることができる。この設計は、多くの従来のLLMで使用されていたエンコーダー・デコーダー構造からの脱却であり、すべてのモダリティを共同で処理する単一のトランスフォーマーを支持する。

トレーニングでは、書き起こされた音声付きの動画クリップや画像キャプションなどのペアのマルチモーダル例を生成するためにデータ拡張技術が採用された。モデルは、多様なデータタイプにわたるトレーニングを安定させるためにレイヤー正規化残差接続を使用している。Google DeepMindは、このアプローチにより、各モダリティに個別のファインチューニング段階が必要になることが減ったと報告した。

モデルのバリエーションと機能

Gemini 3は、さまざまなユースケースに対応するために複数の構成で提供されており、以前のバージョンの階層的アプローチを継続している。ラインナップには、複雑な推論タスク用のGemini 3 Ultra、一般的なアプリケーション用のGemini 3 Pro、低遅延応答用のGemini 3 Flash、リソース制約のある環境向けのGemini 3 Flash Liteが含まれる。各バリアントは同じネイティブなマルチモーダルコアを共有するが、パラメータ数と速度対精度の最適化が異なる。

機能には、音声統合によるリアルタイム動画分析、テキスト記述からの画像生成、クロスモーダル検索(例えば、音声クエリに基づいて動画内の特定の瞬間を見つけること)が含まれる。モデルはまた、制御可能な出力生成のためのtop-pサンプリング温度スケーリングをサポートし、Gemini 2.0から継承された機能である、信頼性を検証するための透かし入りのテキスト読み上げを生成できる。

開発者向けに、Gemini 3はGoogle CloudのVertex AIおよびAI Studioプラットフォームを通じてアクセス可能であり、ストリーミング音声および動画入力をサポートするAPIを備えている。モデルは最新情報の取得のためにGoogle検索と統合され、ウェブおよびモバイルインターフェース全体でGeminiチャットボットを駆動する。

パフォーマンスとベンチマーク

発表時点で、Google DeepMindはGemini 3 Ultraがいくつかの業界ベンチマークで前モデルと競合モデルを上回ったと報告したが、具体的なスコアは完全には開示されなかった。同社は、モダリティを別々に処理するモデルよりもネイティブアーキテクチャが有利となる、視覚的質問応答や動画理解などのマルチモーダル推論タスクでの改善を主張した。

以前のGeminiバージョンは高い期待を設定していた。Gemini Ultraは、57科目のMassive Multitask Language Understanding(MMLU)テストで90%のスコアを達成し、人間の専門家のパフォーマンスを上回った最初のLLMであった。Gemini 3はこの遺産を基盤としており、初期の報告ではVideo-MMLUやAudioQAなどのマルチモーダルベンチマークで強い結果を示しているが、発表日時点では独立した検証は進行中であった。

モデルのパフォーマンスは、TPUでのトレーニングと、マルチモーダルデータに適応させたバッチ正規化技術の使用に起因している。Google DeepMindは、Gemini 3の統一アーキテクチャが、初期のマルチモーダルシステムで一般的な問題であるモダリティ固有コンポーネント間のエラー伝播を低減すると強調した。

統合とエコシステム

Gemini 3は、以前のGeminiリリースのパターンに従い、検索、Chrome、Google Workspaceを含むGoogleの製品エコシステム全体に統合されている。モデルは、2024年2月にBardからブランド名を変更したGeminiチャットボットを駆動する。Androidでは、Gemini 3 Nanoがデバイス上のタスク向けに最適化されており、クラウド接続なしで画像と音声のオフライン処理を可能にする。

ハードウェアパートナーシップにおいて、GoogleはSamsung Electronicsと協力し、2025年初頭に発表されたGalaxy S25スマートフォンラインナップにGemini 3を統合した。これは、2024年1月にGemini NanoとProをGalaxy S24に搭載したパートナーシップに続くものである。統合には、ビデオ通話のリアルタイム翻訳や、自然言語コマンドによるデバイス上の写真編集などの機能が含まれる。

エンタープライズユーザー向けに、Gemini 3はGoogle Cloudを通じて利用可能であり、AI-as-a-service市場でAmazon Web ServicesMicrosoft Azureと競合している。Googleはまた、2025年6月にオープンソースのAIエージェントであるGemini CLIを導入し、Geminiの機能をターミナルにもたらし、コーディング、自動化、問題解決タスクをサポートし、個人開発者には無料の使用制限を提供している。

安全性と規制

Google DeepMindは、オリジナルのGemini発表以来の同社の表明されたアプローチと一致して、Gemini 3の安全性テストを強調した。同社は、2023年10月にジョー・バイデン大統領が署名した大統領令に沿って、テスト結果を米国連邦政府と共有した。英国政府との協議も継続され、2023年11月のブレッチリー・パークでのAI安全サミットで確立された原則に従った。

安全対策には、生成された画像と音声の悪用を防ぐための透かしが含まれており、これはGemini 2.0で導入され、Gemini 3で拡張された機能である。モデルには有害な出力を減らすためのフィルターが含まれており、GoogleはGemini 3がGemini 1.0の慎重な展開と同様に、広範な展開の前に広範な評価を受けると述べた。

2025年11月の発表時点で、Gemini 3は当初英語でのみ利用可能であり、多言語展開の計画があった。Googleは、追加言語と地域的な利用可能性が、規制当局の承認を条件として、その後数ヶ月にわたって展開されることを示した。

競争環境

Gemini 3は、OpenAIのGPT-4およびGPT-4o、AnthropicのClaude 3、そしてAI21 LabsInflection AIなどの企業からの他のモデルが支配する競争の激しい市場に参入する。Googleのネイティブなマルチモーダルアプローチは、2023年のGeminiの初期発表に応じて加速された、GPT-4へのOpenAIの視覚と音声の統合への直接的な挑戦である。

業界アナリストは、Gemini 3の統一アーキテクチャがマルチモーダルAIの新しい標準を設定し、競合他社の将来のモデルに影響を与える可能性があると指摘した。この発表はまた、Google DeepMindとOpenAIの間の継続的な競争を浮き彫りにしており、両社は汎用人工知能(AGI)の達成を競っている。GoogleのTPUへの投資とBroadcomなどのチップメーカーとのパートナーシップはハードウェア上の利点を提供するが、OpenAIはクラウドプロバイダーを通じてNVIDIA GPUに依存している。

Gemini 3のリリースは、視覚データと聴覚データの同時処理が重要であるメディア、ヘルスケア、ロボティクスなどの業界でのマルチモーダルAIの採用を加速すると期待されている。Google DeepMindは、物理システムとGeminiを組み合わせる初期の探求に基づいて、将来のロボティクスとの統合を示唆している。

将来の方向性

Google DeepMindはGemini 3の反復を継続する計画であり、効率を改善し、Gemini 1.5の100万トークン容量を超えてコンテキストウィンドウを拡張するアップデートが期待されている。同社はまた、モデルプルーニングと量子化を通じて計算コストを削減する方法を模索しており、モデルを小規模な開発者にとってよりアクセスしやすくしている。

研究の方向性には、Gemini 3をWaymoの自動運転システムや他のロボティクスアプリケーションと統合し、そのマルチモーダル理解をリアルタイムの意思決定に活用することが含まれる。さらに、Googleは科学的研究、例えば複数のモダリティにわたる実験データの分析におけるGemini 3の使用を調査している。

発表時点で、Google DeepMindはGemini 4のタイムラインを発表していないが、2023年12月のGemini 1.0から2025年11月のGemini 3までの急速な開発ペースは、毎年のアップデートが継続することを示唆している。同社のネイティブなマルチモーダリティへのコミットメントは、Gemini 3を、複数の感覚を通じて世界と相互作用する将来のAIシステムのための基盤モデルとして位置づけている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:google-deepmind·multimodal-ai·large-language-model·ai-launch
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴