谷歌Gemini 3音频发布

译自英文

Google Gemini 3 Audio于2025年11月发布,是Google DeepMind推出的先进语音和音乐生成模型,基于Gemini系列多模态大型语言模型构建。它增强了实时音频合成和交互式语音能力。

Google Gemini 3 Audio 是Google DeepMind于2025年11月发布的一种多模态大型语言模型,专注于先进的语音和音乐生成。作为Gemini系列的一部分,该系列包括Gemini Pro、Gemini Flash和Gemini Deep Think等模型,Gemini 3 Audio将该系列的能力扩展到了高保真音频合成,支持实时对话语音、歌唱和器乐创作。此次发布是在对Gemini架构进行一系列迭代更新之后进行的,使其成为OpenAIAnthropic等其他生成式音频系统的直接竞争对手。

Gemini 3 Audio基于早期Gemini模型的基础设计,这些模型最初于2023年12月6日发布,作为LaMDA和PaLM 2的继任者。该模型整合了Neural networkTransformer (architecture)架构,利用Multi-Head AttentionCross-Attention机制,在处理文本和其他模态的同时生成音频。与仅处理文本的前代模型不同,Gemini 3 Audio在包括语音、音乐和环境声音在内的多样化音频数据集上进行训练,使其能够生成符合上下文的发声和旋律。其发布标志着Generative AI领域的重要一步,特别是在语音助手、内容创作和互动娱乐等应用中。

开发背景

Gemini 3 Audio的开发可追溯到Google在Google DeepMind下的更广泛AI战略,该部门于2023年合并了Google Brain和DeepMind。早期Gemini模型从一开始就设计为多模态,能够同时处理文本、图像、音频、视频和代码。这种方法与许多同时期主要关注文本的Large language model不同。最初于2023年12月发布的Gemini 1.0包括Ultra、Pro和Nano变体,其中Pro和Nano被集成到Google的Bard聊天机器人和Pixel智能手机中。后续版本,如Gemini 1.5和Gemini 2.0,引入了更大的上下文窗口、混合专家架构,以及通过Multimodal Live API实现的实时音频和视频交互。

到2025年,Google已将Gemini系列扩展到包括专注于推理的Gemini Deep Think和专注于速度的Gemini Flash等专门模型。Gemini 3 Audio源于这一系列,专门聚焦于音频生成。该模型的开发涉及与MIT CSAILStanford AI LabBAIR (Berkeley AI Research)研究人员的合作,尽管具体贡献未公开详细说明。Google DeepMind的领导层,包括Demis Hassabis,强调了将AlphaGo式强化学习与生成能力相结合的重要性,这一原则也延续到了音频合成中。

技术架构

Gemini 3 Audio采用了一种混合架构,结合了Encoder-Decoder ArchitectureSequence-to-Sequence (Seq2Seq)框架。该模型使用Residual Network (ResNet)骨干进行特征提取,随后通过Layer NormalizationBatch Normalization来稳定训练。音频通过基于频谱图的输入层进行处理,该层将原始波形转换为时频表示。然后,模型应用Positional Encoding来保留时间顺序,使其能够在较长时间内生成连贯的语音和音乐。

一个关键创新是在文本和音频流之间使用Cross-Attention,使模型能够将口语单词与音符或音效对齐。这通过生成过程中的Top-K SamplingTop-P (Nucleus) Sampling得到补充,以控制输出多样性。该模型还整合了Temperature Scaling来调整创造性,以及Beam Search用于需要时的确定性输出。训练依赖于Adam (Optimizer)Stochastic Gradient Descent Variants,并使用Gradient Clipping来防止不稳定性。该模型在Google的张量处理单元基础设施上进行训练,类似于早期Gemini版本,并针对Google CloudMicrosoft Azure平台上的低延迟推理进行了优化。

能力与特性

Gemini 3 Audio在音频生成的多个领域表现出色。在语音方面,它能够生成带有情感细微差别(如笑声、犹豫和强调)的自然声音。它支持多种语言,并能模仿特定的说话风格,但出于伦理准则,语音克隆仅限于授权用户使用。在音乐方面,该模型能够创作各种流派(从古典到电子)的原创作品,并能生成具有连贯和声和节奏的器乐音轨。它还能处理音效,如脚步声或雨声,用于视频游戏和电影中。

该模型的实时能力尤为突出。它能够以极低的延迟进行口语对话,适合虚拟助手和客户服务机器人。它还支持歌唱,这是使其区别于许多竞争对手的一个特性。音频输出包含水印,以识别AI生成的内容,这是Google在Gemini 2.0中引入的做法。与android和google-chrome的集成允许设备端处理,减少对云服务器的依赖。

发布与可用性

Gemini 3 Audio于2025年11月15日在Google DeepMind主办的虚拟活动中发布。此次发布包括面向开发者的API,可通过Google CloudVertex AI获取。定价采用分级模式,提供有限使用的免费层级和重度使用的订阅计划。该模型最初仅支持英语,并计划在2026年初扩展到其他语言。Google还发布了适用于android和ios的配套应用,使用户能够直接测试该模型的能力。

与早期Gemini模型逐步推出不同,Gemini 3 Audio在发布时即广泛可用,这反映了Google对其安全措施的信心。该公司表示,已进行了广泛测试以防止滥用,包括深度伪造检测和内容过滤。还宣布与Samsung ElectronicsApple建立合作伙伴关系,将该模型集成到其设备中,尽管这些集成预计将在2026年推出。

反响与影响

对Gemini 3 Audio的初步评价是积极的,评论者称赞其自然的语音合成和音乐创造力。科技记者指出,在盲听测试中,它在情感表达方面优于OpenAIAnthropic的类似产品。然而,一些研究人员对滥用的可能性表示担忧,例如生成误导性音频或未经授权的语音复制品。Google通过实施严格的使用政策,并与Nokia Bell LabsXerox PARC合作进行水印研究来回应这些担忧。

此次发布对Generative AI市场产生了重大影响,促使竞争对手加速推出自己的音频模型。Amazon Web ServicesOracle Cloud Infrastructure宣布计划提供类似服务,而GroqSambaNova则专注于优化音频工作负载的推理硬件。该模型还影响了学术研究,来自University of TorontoCarnegie Mellon University的论文将其架构作为基准进行引用。

伦理与安全考量

Google DeepMind为Gemini 3 Audio实施了多项保障措施。该模型包含一个分类器,用于检测和阻止有害内容,如仇恨言论或露骨材料。语音克隆需要用户验证,生成的音频带有可追踪的数字签名水印。该公司还发布了一份透明度报告,详细说明了模型的训练数据来源,其中包括授权音乐和公共语音数据集。

与早期Gemini版本一致,Google与政府监管机构进行了接触。该公司按照一项关于AI的行政命令,与美国联邦政府分享了安全测试结果,并参与了与英国政府关于AI安全峰会原则的讨论。这些努力旨在使模型符合负责任AI发展的国际标准。

未来方向

Google计划定期更新Gemini 3 Audio,预计2026年中期将推出3.5版本。未来的改进可能包括多语言音乐生成、改进的实时协作,以及与WaymoTesla的集成,用于车载语音界面。该公司还在探索使用强化学习从人类反馈中优化输出质量。截至2025年底,Gemini 3 Audio代表了Artificial intelligence音频领域的最先进成就,对娱乐、可访问性和人机交互具有深远影响。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:google-deepmind·generative-ai·audio-generation·large-language-model
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史