Google Gemini 3 是由 Google DeepMind 开发的多模态大型语言模型系列,于 2025 年 11 月发布。Gemini 3 新闻发布指的是此次发布的公开公告,该公告被视为 人工智能 行业向前迈出的重要一步,也是 2023 年 12 月推出的 Gemini 模型系列的下一代产品。
Gemini 是 Google 早期 LaMDA 和 PaLM 2 模型的继任者,并为 Gemini 聊天机器人提供支持。其名称来源于 Gemini 星座。最初的 Gemini 系列包括 Gemini Pro、Gemini Deep Think、Gemini Flash 和 Gemini Flash Lite,后续版本又扩展了 Gemini 1.5 和 Gemini 2.0。Gemini 3 被定位为迄今能力最强的版本,其基础是多模态方法,使模型能够处理文本、图像、音频、视频和计算机代码。
背景
Google 于 2023 年 5 月 10 日在 Google I/O 主题演讲中首次宣布了 Gemini,这是一个由子公司 Google DeepMind 开发的 大型语言模型。它被描述为 PaLM 2 的更强大继任者,PaLM 2 也在该活动中亮相。Google 首席执行官桑达尔·皮查伊当时表示,Gemini 仍处于早期开发阶段。与许多其他语言模型不同,Gemini 从一开始就被设计为多模态模型,这意味着它可以同时处理多种类型的数据,包括文本、图像、音频、视频和计算机代码。该项目是 DeepMind 和 Google Brain 的合作成果,这两个 Google 部门后来合并为 Google DeepMind。
在接受《Wired》采访时,DeepMind 首席执行官戴密斯·哈萨比斯表示,Gemini 的高级能力将使其超越运行在 GPT-4 上的 OpenAI 的 ChatGPT。哈萨比斯强调了 DeepMind 的 AlphaGo 项目的优势,该项目在 2016 年击败围棋冠军李乭石时引起全球关注,并表示 Gemini 将结合 AlphaGo 的力量与其他 Google DeepMind 语言模型。2023 年 8 月,The Information 报道称,Google 的目标是在 2023 年底发布,并希望通过将对话文本能力与 AI 驱动的图像生成相结合来超越 OpenAI 和其他竞争对手。据报道,Google 联合创始人谢尔盖·布林被召回复出协助 Gemini 的开发,同时还有来自 Google Brain 和 DeepMind 的数百名工程师。由于 Gemini 是在 YouTube 视频的转录文本上训练的,因此聘请了律师来过滤可能受版权保护的材料。
发布前的开发
2023 年 12 月 6 日,皮查伊和哈萨比斯在一次虚拟新闻发布会上宣布了 Gemini 1.0。最初的版本包含三个模型:用于高度复杂任务的 Gemini Ultra、用于广泛任务的 Gemini Pro 以及用于设备端任务的 Gemini Nano。发布时,Gemini Pro 和 Nano 分别集成到 Bard 和 Pixel 8 Pro 智能手机中。Gemini Ultra 计划为后来的“Bard Advanced”层级提供支持,并于 2024 年初向软件开发人员开放。Google 表示,由于需要进行广泛的安全测试,Gemini 要到次年才会广泛可用。Gemini 在 Google 的张量处理单元上进行训练,其名称也参考了 NASA 的 Project Gemini 以及 DeepMind 与 Google Brain 的合并。
据报道,Gemini Ultra 在多项行业基准测试中表现优于 GPT-4、Anthropic 的 Claude 2、Inflection AI 的 Inflection-2、Meta 的 LLaMA 2 和 xAI 的 Grok 1。它也是第一个在 57 个主题的大规模多任务语言理解测试中超过人类专家的语言模型,得分达到 90%。Gemini Pro 于 2023 年 12 月 13 日在 AI Studio 和 Vertex AI 上向 Google Cloud 客户开放。根据美国总统乔·拜登于 2023 年 10 月签署的行政命令,Google 表示将与联邦政府共享 Gemini Ultra 的测试结果。该公司还与英国政府进行了讨论,以遵守在布莱切利园举行的 AI 安全峰会上的原则。
2024 年 1 月,Google 与 三星 合作,将 Gemini Nano 和 Gemini Pro 集成到 Galaxy S24 智能手机系列中。次月,Bard 和 Duet AI 统一到 Gemini 品牌下,并通过 Google One 的新 AI Premium 层级发布了带有 Ultra 1.0 的 Gemini Advanced。2024 年 2 月,Google 推出了 Gemini 1.5,称其比 1.0 Ultra 更强大,具有新的架构、专家混合方法以及更大的 100 万 token 上下文窗口。同月,Google 推出了 Gemma,这是一个更小、免费且开源的 Gemini 模型系列。在 2024 年 5 月 14 日的 Google I/O 主题演讲中,Google 宣布了 Gemini 1.5 Flash,并计划通过其 Built-in AI 架构将针对桌面优化的 Gemini Nano 版本集成到 Chrome 浏览器中。两个更新模型 Gemini-1.5-Pro-002 和 Gemini-1.5-Flash-002 于 2024 年 9 月 24 日发布。
2024 年 12 月 11 日,Google 宣布了 Gemini 2.0 Flash Experimental。该版本引入了用于实时音频和视频交互的多模态实时 API、带有水印的原生图像和可控文本到语音生成,并集成了 Google 搜索。2025 年 6 月,Google 推出了 Gemini CLI,这是一个开源 AI 代理,将 Gemini 功能带入终端,提供编码、自动化和问题解决功能,并为个人开发者提供了慷慨的免费使用限制。这些发布为当年晚些时候的 Gemini 3 发布奠定了基础。
2025 年 11 月的发布活动
Gemini 3 新闻发布于 2025 年 11 月以虚拟新闻活动的形式举行。Google DeepMind 将 Gemini 3 作为 Gemini 2.0 的继任者和 Gemini 系列的最新主要版本推出。该活动在 生成式 AI 行业引起了广泛关注,并与 2023 年 12 月最初的 Gemini 1.0 公告进行了比较。据 Google 称,Gemini 3 在推理、长上下文理解和多模态输出方面进行了改进,并基于 Gemini 2.0 中引入的功能,如原生图像生成和可控文本到语音。
与早期的 Gemini 发布一样,该公司强调了安全测试和负责任部署。Google 表示将继续与政府机构共享评估结果,遵循为 Gemini Ultra 设定的先例。该公司还强调了 Gemini 3 与 Google 服务(包括搜索、Chrome 和 Google Cloud)的集成。在活动中,Google 宣布 Gemini 3 将通过 Vertex AI 和 AI Studio 向开发人员提供,扩展了 2023 年 12 月用于 Gemini Pro 的发布模式。
模型系列与技术架构
Gemini 3 延续了使 Gemini 系列区别于纯文本大型语言模型的多模态设计。底层架构基于 Transformer 模型,这是一种于 2017 年引入的 深度学习 方法,已成为现代语言模型的标准。与 Gemini 1.5 一样,Gemini 3 预计将使用专家混合设计,其中 神经网络 的不同部分针对不同类型的输入被激活。这种方法有助于模型处理大量数据,同时保持计算成本可控。
Gemini 系列历来包含多个层级以服务于不同的用例。最初的阵容包括 Gemini Ultra、Pro 和 Nano,后来的版本增加了 Flash 和 Flash Lite。对于 Gemini 3,Google 没有立即披露完整的模型变体集,但预计发布将包括 Pro、Flash 和 Deep Think 层级。截至发布时,详细的规格参数(如参数数量和训练数据大小)尚未完全公开。Google 表示,Gemini 3 是在其张量处理单元上训练的,延续了早期 Gemini 模型使用的硬件策略。
该模型的多模态能力使其能够处理和生成文本、图像、音频和视频。这是 机器学习 领域的一个关键差异化因素,因为许多模型仅限于单一模态。Gemini 3 在单一系统中组合这些模态的能力,被视为朝着更通用的、能够以更丰富方式与世界交互的人工智能系统迈出的一步。
行业与竞争背景
Gemini 3 的发布正值大型语言模型市场竞争激烈之际。OpenAI 发布了 GPT-4 并持续更新其 ChatGPT 服务,而 Anthropic 则开发了 Claude 系列模型。Google 将 Gemini 3 定位为这些系统的直接竞争对手,其基础是早期 Gemini 版本的基准性能。Gemini Ultra 已经在多项行业基准测试中优于 GPT-4 和 Claude 2,Google 声称 Gemini 3 扩大了这一领先优势,尽管截至发布时尚未有独立验证。
该活动还发生在对 AI 基础设施投资日益增长的背景下。主要云提供商,包括 Google Cloud、Amazon Web Services 和 Microsoft Azure,都在竞相提供领先模型的访问权限。Google 决定通过 Vertex AI 和 AI Studio 提供 Gemini 3,是其吸引开发人员和企业客户更广泛战略的一部分。该公司还面临着来自开源模型发布的压力,这导致了 2024 年 2 月 Gemma 的推出。Gemini 3 的发布被视为试图维持 Google 在 AI 行业前沿地位的努力,同时解决有关安全、版权以及大规模模型训练对环境影响的担忧。
可用性与生态系统
Gemini 3 在发布时通过多种渠道提供。开发人员可以通过 Google Cloud 的 Vertex AI 和 AI Studio 访问该模型,遵循与 2023 年 12 月 Gemini Pro 相同的路径。Google 还表示,Gemini 3 将集成到 Gemini 聊天机器人以及其他 Google 产品中,包括搜索、Chrome 和 Workspace。这反映了为 Gemini 1.0 宣布的集成计划,其中包括搜索、广告、Chrome、Duet AI 和 AlphaCode 2。
在消费者方面,Google 此前曾与三星合作,将 Gemini Nano 和 Pro 引入 Galaxy S24,预计 Gemini 3 将出现在未来的 Android 设备中。2025 年 6 月推出的开源 Gemini CLI 也已更新以支持 Gemini 3,为开发人员提供了用于编码和自动化任务的终端界面。Google 更广泛的生态系统策略涉及通过专有服务和开放工具两种方式提供 Gemini,这是该公司自 Gemma 发布以来一直在完善的平衡。
反响与意义
Gemini 3 新闻发布被广泛报道为 AI 行业的一件大事。分析人士指出,此次发布距离最初的 Gemini 1.0 公告不到两年,反映了该领域的快速发展步伐。该活动凸显了 Google DeepMind 对多模态 AI 的持续投资及其与 OpenAI 和 Anthropic 竞争的努力。截至发布时,Gemini 3 的独立基准结果尚未公布,该模型的长期影响仍有待观察。尽管如此,此次发布巩固了 Google DeepMind 作为人工智能领域领先研究机构之一的地位,其模型系列已从早期的 LaMDA 和 PaLM 2 系统演变为生成式 AI 的广泛平台。