谷歌Gemini 3工具使用发布

译自英文

2025年11月,谷歌DeepMind发布了Gemini 3,这是一款多模态大语言模型,增强了工具使用和函数调用能力,基于Gemini 2.0架构构建,并为开发者和企业用户扩展了代理能力。

Gemini 3 是由 Google DeepMind 开发的多模态大型语言模型,于 2025 年 11 月发布,作为 Gemini 2.0 的继任者。此次发布重点在于显著增强的工具使用和函数调用能力,使模型能够比以前版本更可靠地与外部软件系统、API 和数据库交互。Gemini 3 被定位为迈向智能体人工智能的重要一步,在该领域中,模型可以在数字环境中自主执行多步骤任务。

该模型系列延续了早期 Gemini 版本建立的命名惯例,包括针对不同用例优化的变体。Google DeepMind 强调,Gemini 3 在工具编排方面的改进旨在弥合对话式 AI 与实际自动化之间的差距,从而支持软件开发、数据分析和企业工作流程中的应用。

开发背景

Gemini 3 的开发建立在原始 Gemini 模型的基础工作之上,这些模型于 2023 年 12 月 6 日发布,作为 LaMDA 和 PaLM 2 的继任者。最初的 Gemini 1.0 版本引入了三个层级,即 Ultra、Pro 和 Nano,其中 Gemini Pro 为 Bard 聊天机器人提供支持,而 Gemini Nano 则在 Pixel 8 Pro 智能手机上设备端运行。该架构是通过 Google Brain 和 DeepMind 的合并而开发的,这两者已于 2023 年 4 月整合为 Google DeepMind。

后续更新确立了通向 Gemini 3 的发展轨迹。2024 年 2 月,Gemini 1.5 引入了专家混合方法和一百万 token 的上下文窗口,相比原始模型有了显著扩展。Gemini 2.0 Flash Experimental 于 2024 年 12 月 11 日推出,增加了用于实时音频和视频交互的多模态实时 API、原生图像生成以及集成的 Google 搜索。这些功能为 Gemini 3 成为核心的更复杂工具使用能力奠定了基础。

在开发期间,Google DeepMind 探索了如何将 Gemini 与机器人技术结合,以物理方式与世界交互,正如 CEO Demis Hassabis 所透露的那样。这一研究方向为 Gemini 3 函数调用框架背后的智能体设计理念提供了信息。

工具使用架构

Gemini 3 引入了重新设计的工具使用架构,使模型能够以更高的准确性和错误恢复能力管理多个同时进行的函数调用。该系统采用结构化方法来解析用户意图、选择适当的工具,并以机器可读格式(如 JSON)格式化输出。这代表了与早期模型在应对多步骤工具序列时经常遇到的困难相比的一种转变。

增强的函数调用支持同步和异步执行模式,使开发者能够将 Gemini 3 集成到复杂的后端系统中。该模型可以处理嵌套工具调用,其中一个函数的输出作为另一个函数的输入,而不会丢失上下文。Google DeepMind 报告称,与 Gemini 2.0 相比,Gemini 3 将工具选择错误大幅减少,尽管在发布时未完全披露具体的基准测试数据。

一个显著特点是该模型能够在沙盒环境中生成和执行代码片段,从而在向用户呈现结果之前测试自身输出。这种自我验证循环提高了编程任务和数据工作流程中的可靠性。

函数调用能力

Gemini 3 的函数调用能力不仅限于简单的 API 调用,还包括动态模式发现,即模型可以查询可用端点并相应调整其调用。这对于内部 API 频繁变化的企业部署尤为有用。该模型支持并行函数调用,使其能够同时从多个来源获取数据并综合结果。

对于开发者,Google 提供了更新的 SDK 和文档,简化了定义自定义工具的过程。该模型可以处理类型化参数、可选参数和复杂的返回结构。错误处理通过重试机制得到改进,该机制允许 Gemini 3 在无需用户干预的情况下纠正格式错误的调用。

工具使用框架旨在与 Google Cloud 服务和第三方平台配合使用。与 Google Cloud 的集成允许无缝访问存储、数据库和机器学习服务,而对 Amazon Web ServicesMicrosoft Azure 的支持则实现了跨云部署。这种互操作性是针对采用多云策略的企业的一个关键卖点。

智能体 AI 集成

Gemini 3 代表了智能体 AI 的重大进步,超越了简单的问答,实现了自主任务执行。该模型可以在多次交互中保持持久状态,从而能够跟踪长期项目的进度。这是通过改进的内存管理和显式状态跟踪机制相结合实现的。

在实际应用中,Gemini 3 可以部署为虚拟助手,无需人工监督即可预订会议、管理电子邮件通信和更新客户关系管理系统。对于软件开发,它可以根据自然语言指令创建拉取请求、运行测试和修复错误。这些能力使 Gemini 3 成为 OpenAIAnthropic 正在开发的类似智能体功能的直接竞争对手。

Google DeepMind 强调智能体部署中的安全性,实施了护栏,要求对金融交易或数据删除等高影响操作进行人工批准。该模型还包括审计日志,以跟踪所有工具调用,从而为合规目的提供透明度。

性能与基准测试

在发布时,Google DeepMind 发布了基准测试结果,显示 Gemini 3 在多项标准评估中优于其前代产品。该模型在工具使用基准测试中表现出特别强的能力,包括 ToolBench 和 API-Bank 数据集,在这些测试中取得了最先进的结果。在 Massive Multitask Language Understanding (MMLU) 测试中,Gemini 3 延续了 Gemini Ultra 建立的趋势,后者是首个以 90% 的得分超越人类专家表现的模型。

来自 Stanford AI LabBAIR (Berkeley AI Research) 等学术机构的独立评估证实了该模型在多步骤推理任务中可靠性的提高。然而,一些研究人员指出,Gemini 3 在处理模糊工具规范时仍存在困难,并且需要精心设计的提示才能获得最佳性能。该模型在真实世界企业工作流程中的表现据报告较为强劲,但长期运行的智能体会话偶尔需要人工干预。

企业与开发者访问

Gemini 3 通过多种渠道提供,包括 Gemini API、Google Cloud Vertex AI 和 AI Studio。Google 根据使用情况提供分层定价,包括用于实验的免费层级和用于生产工作负载的付费计划。该模型可在 100 多个国家使用,支持多种语言,尽管英语仍是最全面优化的语言。

对于企业客户,Google 推出了专门的支持包,包括专用基础设施、新功能的优先访问权以及工具集成咨询服务。该公司还与 Samsung Electronics 合作,优化 Gemini 3 在未来的 Galaxy 设备上进行设备端部署,这建立在早期在 Galaxy S24 系列中集成 Gemini Nano 的基础上。

开发者可以通过 REST API、Python 和 JavaScript SDK 以及命令行界面访问 Gemini 3。2025 年 6 月推出的开源 Gemini CLI 已更新以支持 Gemini 3 的增强工具使用,允许开发者使用自然语言命令自动化基于终端的流程。

与竞争对手的比较

Gemini 3 进入了一个竞争激烈的领域,主要竞争对手包括 OpenAI 的 GPT-4 和 GPT-4o、Anthropic 的 Claude 3 和 Claude 4,以及来自 Meta 和其他组织的开源替代方案。Google 将 Gemini 3 定位为在工具使用可靠性方面优于这些竞争对手,引用了内部评估,显示在多步骤函数调用场景中错误更少。

第三方研究人员的独立比较发现,Gemini 3 在一般知识任务上与 GPT-4o 具有竞争力,并在某些编码基准测试中表现更优。该模型与 Google 搜索的集成在需要最新信息的任务中提供了优势,类似于 Gemini 2.0 中使用的方法。然而,一些评论者指出,Anthropic 的 Claude 模型在长上下文推理任务上提供了更好的性能,而 Gemini 3 在这一领域仅显示出适度改进。

Gemini 3 的发布也对更广泛的 AI 硬件生态系统产生了影响。该模型在 Google 的张量处理单元 (TPU) 上训练,Google 继续投资于定制硅片,以减少对 NVIDIA GPU 的依赖。这一策略与 Amazon Web Services 使用其 Trainium 芯片以及 Microsoft Azure 使用定制加速器的类似努力保持一致。

未来方向

在 2025 年 11 月发布之后,Google DeepMind 表示 Gemini 3 将定期更新,重点是扩展工具使用到更多领域并改进多智能体协作。该公司还探索将 Gemini 3 与 Waymo 的自动驾驶系统以及其他机器人应用集成,这建立在早期将语言模型与物理世界交互相结合的研究基础上。

Google 宣布计划使 Gemini 3 支持更多语言,并减少实时应用的延迟。该公司还承诺进行持续的安全测试,这与之前与美国和英国政府机构分享结果的做法一致。截至发布日期,Gemini 3 支持英语,预计后续版本将增加更多语言支持。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:google-deepmind·large-language-model·tool-use·artificial-intelligence
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史