Gemini 3 是由 Google DeepMind 开发的多模态大型语言模型(LLM)系列,于 2025 年 11 月发布。它是 2024 年 12 月发布的 Gemini 2.0 的继任者,并延续了始于 2023 年 12 月 Gemini 1.0 的 Gemini 系列。该模型的设计重点是增强推理能力和逐步思考,使其能够以更高的透明度和准确性解决数学、科学和编程等领域的复杂问题。Gemini 3 为 Gemini 聊天机器人提供支持,并可通过 Google Cloud 服务(包括 Vertex AI 和 AI Studio)以及 Gemini CLI 用于终端交互。
Gemini 3 的发布建立在 Google DeepMind 推进多模态 AI 的发展轨迹之上,这种 AI 能够同时处理文本、图像、音频、视频和代码。与强调广泛能力的早期版本不同,Gemini 3 引入了精炼的推理引擎,在得出最终答案之前显式生成中间步骤。这一功能通常被称为思维链推理,使模型能够解释其逻辑、验证自身结论,并减少多步骤任务中的错误。2025 年 11 月的发布将 Gemini 3 定位为 OpenAI 和 Anthropic 其他前沿模型的直接竞争对手,Google 强调其在推理基准上的卓越性能以及跨 Google 生态系统(包括 Search、Workspace 和 Android)的集成。
开发与背景
Gemini 3 的开发始于 2024 年 12 月 Gemini 2.0 发布后不久,后者引入了诸如用于实时音频和视频交互的多模态 Live API、原生图像生成以及集成的 Google Search 等功能。由 CEO Demis Hassabis 领导的 Google DeepMind 利用了早期模型(包括 2016 年成名的 AlphaGo 程序)的见解来设计 Gemini 3 的推理能力。该模型在 Google 的张量处理单元(TPU)上训练,这些是定制的 Machine learning 加速器,并采用了混合专家架构以提高效率和可扩展性。这种方法允许模型仅为每个查询激活相关的子网络,从而降低计算成本,同时保持高性能。
在开发过程中,Google DeepMind 与多家研究机构合作,并借鉴了 Deep learning 和 Neural network 设计的进展。团队包括来自 2023 年合并的 Google Brain 和 DeepMind 的工程师,并获得了联合创始人 Sergey Brin 的贡献,他被认为是早期 Gemini 版本的核心贡献者。训练过程涉及大规模数据集,包括 YouTube 视频的转录,法律团队过滤了可能受版权保护的材料。与之前的发布一样,Google 强调了安全测试,并根据美国行政命令和 Bletchley Park AI 安全峰会的国际协议,与美国和英国政府机构分享了评估结果。
发布与可用性
Gemini 3 于 2025 年 11 月在虚拟新闻发布会上正式发布,Google CEO Sundar Pichai 和 Demis Hassabis 展示了新模型。发布包括多个变体:Gemini 3 Pro,设计用于广泛任务;Gemini 3 Ultra,用于高度复杂的推理;Gemini 3 Flash,针对速度和效率优化;以及 Gemini 3 Nano,用于设备端应用。发布时,Gemini 3 Pro 和 Nano 分别集成到 Gemini 聊天机器人和部分 Android 智能手机中,而 Gemini 3 Ultra 则通过 Google Cloud 的 Vertex AI 和 AI Studio 平台提供给开发者。该模型最初以英语发布,计划在后续几个月内进行多语言扩展。
Google 还推出了 Gemini 3 CLI,一个开源命令行工具,将模型的功能带到开发者的终端,提供高级编码、自动化和问题解决功能,并具有慷慨的免费使用限制。此举效仿了公司此前于 2025 年 6 月发布的 Gemini CLI,后者在个人开发者中广受欢迎。11 月的发布伴随着与 Samsung Electronics 的合作,将 Gemini 3 集成到其 Galaxy S26 智能手机系列中,延续了 2024 年 1 月 Gemini 1.5 的类似合作。此外,Google 宣布 Gemini 3 将在 Google Cloud 上提供给企业客户,定价层级基于使用量和模型变体。
增强的推理能力
Gemini 3 的定义性特征是其增强的推理能力,允许模型在生成最终输出之前产生逐步思考过程。这一能力在需要逻辑演绎的领域尤为显著,例如高级数学、科学问题解决和代码生成。在基准测试中,Gemini 3 Ultra 据报道在 Massive Multitask Language Understanding(MMLU)测试中超越了之前的模型,包括 Gemini 2.0 和 OpenAI 的 GPT-4 等竞争对手,得分超过 90%。该模型还在专门的推理基准上表现出改进的性能,例如涉及多跳问题和因果推断的基准。
逐步思考通过多种技术的组合实现,包括 Chain-of-thought 提示、来自人类反馈的 Reinforcement learning(RLHF)和 Reinforcement Learning from AI Feedback (RLAIF)(来自 AI 反馈的强化学习)。这些方法使模型能够将复杂查询分解为更小、可管理的子问题,解决每个子问题,然后综合结果。这种方法不仅提高了准确性,还为用户提供了模型如何得出答案的透明解释,这对调试、教育和建立信任很有价值。然而,推理过程可能增加延迟,Google 已优化 Gemini 3 Flash 以平衡速度和推理深度,适用于实时应用。
多模态与集成功能
Gemini 3 延续了其前身的多模态传统,同时处理文本、图像、音频、视频和代码。该模型可以从文本描述生成图像,创建具有可控文本转语音的音频响应,并实时分析视频内容。一个显著的新增功能是多模态 Live API,支持实时音频和视频交互,使虚拟助手、翻译服务和交互式教育工具等应用成为可能。原生图像生成包括水印以识别 AI 创建的内容,解决关于错误信息的担忧。
与 Google 生态系统的集成非常广泛。Gemini 3 为 Google Search 中的功能提供支持,为复杂查询提供更详细和推理性的答案。在 Google Workspace 中,它增强了 Duet AI,协助文档起草、电子表格分析和电子邮件撰写。在 Android 上,Gemini 3 Nano 支持设备端处理,用于摘要和智能回复等任务,具有隐私优势,因为数据保留在设备上。该模型还与 Google Cloud 服务集成,允许开发者使用 API 和 SDK 构建自定义应用。此外,Gemini 3 支持与外部工具和数据库的集成,使其能够访问最新信息并执行诸如预订约会或查询业务系统等操作。
性能与基准
在独立评估中,Gemini 3 在多个基准上表现出强劲性能。在涵盖 57 个主题的 MMLU 测试中,Gemini 3 Ultra 得分 92%,超过人类专家表现,并超过 Gemini 1.0 Ultra 的 90% 得分。在编码基准上,例如 HumanEval 和 Codeforces,Gemini 3 Pro 优于 GPT-4 和 Claude 3.5,生成的代码通过率更高,并且更好地遵循问题规范。在数学推理中,该模型解决了 MATH 数据集中更高比例的问题,特别是那些需要多步推导的问题。
然而,一些研究人员指出,Gemini 3 的推理改进伴随着权衡。模型的逐步思考可能冗长,在某些情况下,它可能过度解释简单查询,导致 token 使用量增加和计算成本上升。Google 通过提供可配置的推理深度来解决这一点,允许用户选择简洁或详细的解释。此外,虽然 Gemini 3 在结构化推理任务中表现出色,但其在开放式创意写作上的性能仍与之前的模型相当,在原创性或风格多样性方面没有显著提升。
竞争格局
Gemini 3 的发布加剧了 Large language model 市场的竞争。OpenAI 已发布 GPT-4 并正在开发 GPT-5,通过加速其自身的推理重点模型(例如 o1 系列,也采用逐步思考)来回应。Anthropic 凭借其 Claude 3.5 和 Claude 4 模型,强调安全性和可解释性,将自己定位为关注 AI 对齐的企业客户的替代选择。其他参与者,包括 meta(使用 LLaMA 3)、Mistral AI 和 xAI(使用 Grok 3),继续发布开源和专有模型,尽管在发布时没有匹配 Gemini 3 报告的基准分数。
Google 将 Gemini 3 集成到其产品中的策略赋予其分发优势,因为该模型可通过 Search、Android 和 Chrome 访问数十亿用户。然而,对数据隐私和垄断行为的担忧导致监管审查,特别是在欧盟,对 Google 的 AI 合作伙伴关系和数据处理的调查正在进行中。作为回应,Google 强调其对负责任 AI 开发的承诺,发布透明度报告,并在某些地区提供数据收集的选择退出选项。
未来方向
在 2025 年 11 月发布之后,Google DeepMind 宣布了 Gemini 3 迭代更新的计划,包括针对特定行业(如医疗保健、金融和教育)的微调版本。该公司还暗示了预计于 2026 年中期推出的 Gemini 3.5,它将纳入 Machine learning 效率的进展,并可能提供更大的上下文窗口,基于 Gemini 1.5 中引入的一百万 token 能力。将 Gemini 与机器人技术结合的研究,如 Hassabis 在早期发布中提到的,继续进行,物理世界交互的原型正在受控环境中测试。
此外,Google 探索了与其他科技公司的合作,包括 AMD 和 Qualcomm,以优化 Gemini 3 用于边缘设备,并减少对云基础设施的依赖。开源社区获得了 Gemini 3 的较小蒸馏版本,类似于 2024 年 2 月发布的 Gemma 模型,允许研究人员实验推理技术。截至发布日,Gemini 3 代表了 AI 推理的重大进步,但其长期影响将取决于未来几年的采用和精炼情况。
反响与影响
早期对 Gemini 3 的评论总体上是积极的,技术记者和研究人员称赞其推理透明性和在复杂任务上的准确性。教育工作者注意到其作为辅导工具的潜力,因为逐步解释可以帮助学生理解问题解决过程。软件开发者欣赏改进的代码生成和调试辅助,许多人报告称在常规编程任务上花费的时间减少。然而,一些批评者提出了对训练如此大型模型的环境影响以及滥用生成令人信服的错误信息或自动化网络攻击的担忧。
Google 通过强调其数据中心使用可再生能源和对 AI 安全研究的投资来回应这些担忧。该公司还与学术机构合作,例如 MIT CSAIL 和 Stanford AI Lab,研究推理能力 AI 的社会影响。总体而言,Gemini 3 的发布标志着 Generative AI 演变中的一个里程碑,表明大型语言模型可以超越模式匹配,走向更审慎、逻辑性的推理。截至 2025 年 11 月,它被认为是最先进的 AI 系统之一,为用户对对话和分析 AI 工具的期望设定了新标准。