谷歌Gemini 3多模态发布

译自英文

Gemini 3,由Google DeepMind于2025年11月发布,是一款原生多模态大型语言模型,能同时处理文本、图像、视频和音频,接替Gemini 2.0,并为Gemini聊天机器人提供支持。

Gemini 3是由Google DeepMind开发的多模态大型语言模型(LLM)家族,于2025年11月发布,作为Gemini 2.0的继任者。它天生具备多模态能力,即从一开始就同时处理文本、图像、视频和音频,而不是依赖针对每种模态的独立组件。该模型为Gemini聊天机器人提供支持,并以双子座星座命名,延续了2023年12月原始Gemini 1.0发布时确立的命名惯例。

此次发布将Gemini 3定位为OpenAIAnthropic模型的直接竞争对手,Google强调其统一架构是关键差异化因素。与早期通过辅助模块集成多模态能力的版本不同,Gemini 3对所有数据类型进行端到端训练,使其能够在单次处理中跨模态推理。这一设计建立在Google DeepMind的基础工作之上,该公司于2023年合并了DeepMind和Google Brain以加速开发。

开发背景

Gemini 3的开发追溯到最初的Gemini项目,该项目由首席执行官Sundar Pichai于2023年5月10日在Google I/O上首次宣布。初始模型Gemini 1.0于2023年12月6日发布,包含三个变体:Ultra用于复杂任务,Pro用于一般用途,Nano用于设备端处理。它基于Google的张量处理单元(TPU)进行训练,并吸收了DeepMind AlphaGo项目的经验,该项目在2016年击败了围棋冠军李世石。

后续迭代完善了架构。Gemini 1.5于2024年2月发布,引入了混合专家方法和一百万令牌的上下文窗口。Gemini 2.0 Flash Experimental于2024年12月11日发布,增加了多模态实时API,用于实时音频和视频交互。Gemini 3在这些进展的基础上构建,2025年11月的发布将原生多模态作为核心功能,而非附加功能。

开发团队包括来自Google Brain和DeepMind的数百名工程师,联合创始人Sergey Brin作为核心贡献者参与其中,与早期版本的情况相同。训练数据包括YouTube视频的转录文本,法律团队过滤了可能受版权保护的材料,这一做法在Gemini 3中继续沿用。

原生多模态架构

Gemini 3的标志性特征是原生多模态设计,通过统一的transformer架构处理文本、图像、视频和音频。这与早期模型(如Gemini 1.0)通过独立编码器和解码器处理模态的方式形成对比。统一方法使模型能够无需中间转换步骤即可跨模态关联信息,改善了视频理解等任务,实现了同步音频和视觉推理。

该架构利用multi-head attention机制扩展到处理多个输入流。位置编码应用于时间和空间维度,使模型能够跨视频帧跟踪对象,并将语音与相应视觉内容对齐。这一设计偏离了许多先前LLM中使用的encoder-decoder结构,转而采用单一transformer联合处理所有模态。

训练采用了data augmentation技术生成配对多模态示例,例如带转录音频的视频片段和图像标题。模型使用layer normalizationresidual connections来稳定跨多样化数据类型的训练。Google DeepMind报告称,这种方法减少了对每种模态进行单独微调阶段的需求。

模型变体和能力

Gemini 3提供多种配置以满足不同使用场景,延续了先前版本的分级方法。产品线包括用于复杂推理任务的Gemini 3 Ultra、用于一般应用的Gemini 3 Pro、用于低延迟响应的Gemini 3 Flash,以及用于资源受限环境的Gemini 3 Flash Lite。每个变体共享相同的原生多模态核心,但在参数数量和速度与准确性优化方面有所不同。

能力包括带音频集成的实时视频分析、从文本描述生成图像,以及跨模态搜索,例如根据语音查询查找视频中的特定时刻。模型还支持top-p samplingtemperature scaling以控制输出生成,并可生成带水印的文本到语音以验证真实性,这一功能继承自Gemini 2.0。

对于开发者,Gemini 3可通过Google Cloud的Vertex AI和AI Studio平台访问,API支持流式音频和视频输入。该模型与Google Search集成以获取最新信息,并为Web和移动界面上的Gemini聊天机器人提供支持。

性能和基准测试

在发布时,Google DeepMind报告称Gemini 3 Ultra在多个行业基准测试中优于其前代和竞争模型,尽管具体分数未完全披露。公司声称在多模态推理任务(如视觉问答和视频理解)上有所改进,其中原生架构相比分别处理模态的模型具有优势。

先前的Gemini版本设定了高期望:Gemini Ultra是首个在57个主题的大规模多任务语言理解(MMLU)测试中超过人类专家表现(得分90%)的LLM。Gemini 3在此基础上发展,早期报告显示在Video-MMLU和AudioQA等多模态基准测试中表现强劲,但截至发布日独立验证仍在进行中。

模型性能归因于其在TPU上的训练以及为多模态数据改编的batch normalization技术。Google DeepMind强调,Gemini 3的统一架构减少了模态特定组件之间的错误传播,这是早期多模态系统中的常见问题。

集成和生态系统

Gemini 3集成在Google的产品生态系统中,包括Search、Chrome和Google Workspace,遵循早期Gemini发布的模式。该模型为Gemini聊天机器人提供支持,该聊天机器人于2024年2月从Bard更名。在Android上,Gemini 3 Nano针对设备端任务进行了优化,能够在无需云连接的情况下离线处理图像和音频。

在硬件合作方面,Google与Samsung Electronics合作,将Gemini 3集成到2025年初发布的Galaxy S25智能手机系列中。这继2024年1月将Gemini Nano和Pro引入Galaxy S24的合作之后。集成包括视频通话实时翻译和通过自然语言命令进行设备端照片编辑等功能。

对于企业用户,Gemini 3可通过Google Cloud获得,在AI即服务市场中与Amazon Web ServicesMicrosoft Azure竞争。Google还在2025年6月推出了Gemini CLI,这是一个开源AI代理,将Gemini能力带到终端,支持编码、自动化和问题解决任务,并为个人开发者提供免费使用限制。

安全与监管

Google DeepMind强调对Gemini 3进行安全测试,与公司自原始Gemini发布以来的既定方法一致。公司与美国联邦政府共享了测试结果,符合总统Joe Biden于2023年10月签署的行政命令。与英国政府的讨论也在继续,遵循2023年11月在Bletchley Park举行的AI安全峰会上确立的原则。

安全措施包括为生成的图像和音频添加水印以防止滥用,这一功能在Gemini 2.0中引入并在Gemini 3中扩展。模型包含过滤器以减少有害输出,Google表示Gemini 3将在广泛部署之前进行广泛评估,类似于Gemini 1.0的谨慎推出。

截至2025年11月发布,Gemini 3最初仅提供英语版本,计划进行多语言扩展。Google表示其他语言和区域可用性将在后续几个月内逐步推出,需经过监管批准。

竞争格局

Gemini 3进入了一个竞争激烈的市场,主要参与者包括OpenAI的GPT-4和GPT-4o、Anthropic的Claude 3,以及来自AI21 LabsInflection AI等公司的其他模型。Google的原生多模态方法直接挑战OpenAI将视觉和音频集成到GPT-4的做法,这一集成在2023年Gemini最初宣布后加速推进。

行业分析师指出,Gemini 3的统一架构可能为多模态AI设定新标准,可能影响竞争对手的未来模型。此次发布也凸显了Google DeepMind与OpenAI之间的持续竞争,两家公司都在竞相实现人工通用智能(AGI)。Google在TPU上的投资以及与Broadcom等芯片制造商的合作提供了硬件优势,而OpenAI则依赖通过云提供商提供的NVIDIA GPU。

Gemini 3的发布预计将加速多模态AI在媒体、医疗保健和机器人等行业的采用,这些领域同时处理视觉和听觉数据至关重要。Google DeepMind暗示未来将与机器人技术集成,基于早期将Gemini与物理系统结合的探索。

未来方向

Google DeepMind计划继续迭代Gemini 3,预计更新将提高效率并扩展上下文窗口,超越Gemini 1.5的一百万令牌容量。公司还在探索通过model pruning和量化降低计算成本,使模型对小型开发者更易访问。

研究方向包括将Gemini 3与Waymo的自动驾驶系统和其他机器人应用集成,利用其多模态理解进行实时决策。此外,Google正在研究Gemini 3在科学研究中的应用,例如分析跨模态的实验数据。

截至发布,Google DeepMind尚未宣布Gemini 4的时间表,但快速发展步伐,从2023年12月的Gemini 1.0到2025年11月的Gemini 3,表明将持续进行年度更新。公司对原生多模态的承诺将Gemini 3定位为未来AI系统的基础模型,这些系统将通过多种感官与世界交互。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:google-deepmind·multimodal-ai·large-language-model·ai-launch
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史