Google Gemini 3 Audio の発表

英語からの翻訳

Google Gemini 3 Audioは、2025年11月にリリースされた、Google DeepMindによる高度な音声・音楽生成モデルであり、マルチモーダル大規模言語モデルのGeminiファミリーを基盤としています。リアルタイムの音声合成と対話型音声機能を強化しています。

Google Gemini 3 Audioは、2025年11月にGoogle DeepMindがリリースしたマルチモーダル大規模言語モデルであり、高度な音声および音楽生成に特化している。Gemini Pro、Gemini Flash、Gemini Deep Thinkなどのモデルを含むGeminiファミリーの一部として、Gemini 3 Audioは、シリーズの機能を高忠実度のオーディオ合成に拡張し、リアルタイムの会話音声、歌唱、および楽器作曲を可能にする。このリリースは、Geminiアーキテクチャへの一連の反復的な更新に続くものであり、OpenAIAnthropicの他の生成オーディオシステムに対する直接の競争相手として位置づけられた。

Gemini 3 Audioは、2023年12月6日にLaMDAとPaLM 2の後継として初めて発表された初期のGeminiモデルの基盤設計に基づいている。このモデルは、Neural networkおよびTransformer (architecture)アーキテクチャを統合し、Multi-Head AttentionおよびCross-Attentionメカニズムを活用して、テキストや他のモダリティとともにオーディオを処理および生成する。テキストのみの前身とは異なり、Gemini 3 Audioは、音声、音楽、環境音を含む多様なオーディオデータセットでトレーニングされており、文脈に適した発声やメロディーを生成できる。そのリリースは、Generative AI、特に音声アシスタント、コンテンツ作成、およびインタラクティブエンターテインメントのアプリケーションにとって重要なステップとなった。

開発背景

Gemini 3 Audioの開発は、2023年にGoogle BrainとDeepMindを統合したGoogle DeepMindの下でのGoogleの広範なAI戦略に遡る。初期のGeminiモデルは、テキスト、画像、オーディオ、ビデオ、コードを同時に処理する、最初からマルチモーダルになるように設計されていた。このアプローチは、主にテキストに焦点を当てた同時代の多くのLarge language modelとは異なっていた。2023年12月に発表された初期のGemini 1.0には、Ultra、Pro、Nanoのバリエーションが含まれており、ProとNanoはGoogleのBardチャットボットとPixelスマートフォンに統合された。その後のバージョンであるGemini 1.5やGemini 2.0では、より大きなコンテキストウィンドウ、mixture-of-expertsアーキテクチャ、およびMultimodal Live APIを介したリアルタイムのオーディオおよびビデオインタラクションが導入された。

2025年までに、GoogleはGeminiファミリーを拡大し、推論用のGemini Deep Thinkや速度用のGemini Flashなどの専門モデルを含めた。Gemini 3 Audioはこの系統から生まれ、特にオーディオ生成に焦点を当てた。モデルの開発には、MIT CSAILStanford AI Lab、およびBAIR (Berkeley AI Research)の研究者との協力が含まれていたが、具体的な貢献は公に詳細化されていなかった。Google DeepMindのリーダーシップ、特にDemis Hassabisは、AlphaGoスタイルの強化学習と生成能力を組み合わせることの重要性を強調しており、この原則はオーディオ合成にも引き継がれた。

技術アーキテクチャ

Gemini 3 Audioは、Encoder-Decoder ArchitectureおよびSequence-to-Sequence (Seq2Seq)フレームワークを組み合わせたハイブリッドアーキテクチャを採用している。モデルは、特徴抽出にResidual Network (ResNet)バックボーンを使用し、その後にLayer NormalizationおよびBatch Normalizationを適用してトレーニングを安定させる。オーディオは、スペクトログラムベースの入力層を通じて処理され、生の波形を時間周波数表現に変換する。次に、モデルはPositional Encodingを適用して時間的順序を保持し、長時間にわたって一貫性のある音声と音楽を生成できるようにする。

重要な革新は、テキストとオーディオストリーム間のCross-Attentionの使用であり、これによりモデルは話し言葉を音符や効果音と整合させることができる。これは、生成中の出力の多様性を制御するTop-K SamplingおよびTop-P (Nucleus) Samplingによって補完される。モデルはまた、創造性を調整するためのTemperature Scalingと、必要に応じて決定的な出力のためのBeam Searchも組み込んでいる。トレーニングはAdam (Optimizer)およびStochastic Gradient Descent Variantsに依存し、不安定性を防ぐためにGradient Clippingが使用された。モデルは、以前のGeminiバージョンと同様にGoogleのtensor-processing-unitインフラストラクチャでトレーニングされ、Google CloudおよびMicrosoft Azureプラットフォームでの低遅延推論用に最適化された。

機能と特徴

Gemini 3 Audioは、オーディオ生成のいくつかの分野で優れている。音声については、笑い声、ためらい、強調などの感情的なニュアンスを含む自然な音声を生成する。複数の言語をサポートし、特定の話し方を模倣できるが、音声クローニングは倫理ガイドラインにより許可されたユーザーに制限されている。音楽については、クラシックからエレクトロニックまでさまざまなジャンルのオリジナル作品を作曲でき、一貫性のあるハーモニーとリズムを持つ楽器トラックを生成できる。また、ビデオゲームや映画で使用するための足音や雨などの効果音も処理する。

モデルのリアルタイム機能は注目に値する。最小限の遅延で音声対話を行うことができ、仮想アシスタントやカスタマーサービスボットに適している。また、多くの競合他社と区別される機能である歌唱もサポートしている。オーディオ出力には、AI生成コンテンツを識別するための透かしが含まれており、これはGoogleがGemini 2.0で導入した慣行である。androidおよびgoogle-chromeとの統合により、オンデバイス処理が可能になり、クラウドサーバーへの依存が軽減される。

リリースと入手可能性

Gemini 3 Audioは、2025年11月15日にGoogle DeepMindが主催する仮想イベントで発表された。リリースには、Google CloudおよびVertex AIを通じて利用可能な開発者向けAPIが含まれていた。価格は段階的であり、限定的な使用のための無料ティアと、ヘビーユーザー向けのサブスクリプションプランがあった。モデルは当初英語で利用可能であり、2026年初頭に他の言語に拡大する計画があった。Googleはまた、androidおよびios向けのコンパニオンアプリをリリースし、ユーザーがモデルの機能を直接テストできるようにした。

段階的に展開された以前のGeminiモデルとは異なり、Gemini 3 Audioは、安全性対策に対するGoogleの自信を反映して、発売時に広く利用可能になった。同社は、ディープフェイク検出やコンテンツフィルタリングを含む悪用を防ぐために広範なテストが実施されたと述べた。Samsung ElectronicsおよびAppleとのパートナーシップが、モデルをデバイスに統合するために発表されたが、これらの統合は2026年に展開される予定だった。

評価と影響

Gemini 3 Audioの初期レビューは肯定的であり、批評家はその自然な音声合成と音楽的創造性を賞賛した。テックジャーナリストは、ブラインドリスニングテストで、特に感情表現において、OpenAIAnthropicの同様の製品よりも優れていると指摘した。しかし、一部の研究者は、誤解を招くオーディオの生成や無許可の音声レプリカなど、悪用の可能性について懸念を表明した。Googleは、厳格な使用ポリシーを実装し、透かし研究でNokia Bell LabsおよびXerox PARCと提携することで対応した。

このリリースは、Generative AI市場に大きな影響を与え、競合他社に独自のオーディオモデルの開発を加速させた。Amazon Web ServicesおよびOracle Cloud Infrastructureは同様のサービスを提供する計画を発表し、GroqおよびSambaNovaはオーディオワークロード用の推論ハードウェアの最適化に焦点を当てた。このモデルは学術研究にも影響を与え、University of TorontoおよびCarnegie Mellon Universityの論文がそのアーキテクチャをベンチマークとして引用した。

倫理的および安全性の考慮事項

Google DeepMindは、Gemini 3 Audioにいくつかの安全対策を実装した。モデルには、ヘイトスピーチや露骨な素材などの有害なコンテンツを検出してブロックする分類器が含まれている。音声クローニングにはユーザー認証が必要であり、生成されたオーディオには追跡可能なデジタル署名付きの透かしが含まれている。同社はまた、ライセンスされた音楽や公開音声データセットを含むモデルのトレーニングデータソースを詳細に説明した透明性レポートを公開した。

以前のGeminiリリースと同様に、Googleは政府規制当局と関与した。同社は、AIに関する大統領令に従って、米国連邦政府と安全性テスト結果を共有し、AI安全性サミットの原則に関して英国政府との議論に参加した。これらの取り組みは、責任あるAI開発のための国際基準にモデルを合わせることを目的としていた。

今後の方向性

Googleは、Gemini 3 Audioを定期的に更新する計画であり、バージョン3.5が2026年半ばに予想されている。将来の改善には、多言語音楽生成、リアルタイムコラボレーションの改善、および車載音声インターフェース用のWaymoおよびTeslaとの統合が含まれる可能性がある。同社はまた、出力品質を洗練するためのreinforcement-learning-from-human-feedbackの使用も検討している。2025年後半の時点で、Gemini 3 Audioは、エンターテインメント、アクセシビリティ、および人間とコンピューターの相互作用に影響を与える、Artificial intelligenceオーディオにおける最先端の成果を表している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:google-deepmind·generative-ai·audio-generation·large-language-model
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴