# Google Gemini 3 上下文启动

译自英文

2025年11月举行的Google Gemini 3 Context Launch发布了Gemini 3,这是一款多模态大语言模型,拥有100万token的上下文窗口,能够处理长文档。它接替了Gemini 2.0,由Google DeepMind开发。

Google Gemini 3 上下文发布(Gemini 3 Context Launch)于2025年11月宣布,标志着Gemini 3的发布,这是一款由Google DeepMind开发的多模态大型语言模型(LLM)。此次发布因引入了一百万令牌的上下文窗口而备受瞩目,使该模型能够在单次处理中理解和分析极长的文档。这一能力使Gemini 3在人工智能领域,特别是需要深度分析大量文本数据的应用中,成为一项重大进步。

Gemini 3是Gemini模型系列的一部分,该系列包括Gemini Pro、Gemini Flash和Gemini Flash Lite等变体,并作为LaMDA和PaLM 2等早期模型的继任者。该模型设计为多模态,意味着它可以处理并整合多种数据类型,包括文本、图像、音频、视频和计算机代码。2025年11月的发布活动重点介绍了扩展的上下文窗口,这是与先前版本及竞争模型的关键区别。

开发与背景

Gemini 3的开发建立在早期Gemini模型奠定的基础之上。Google最初于2023年5月10日在Google I/O主题演讲中宣布了Gemini,首席执行官桑达尔·皮查伊将其描述为PaLM 2的更强大继任者。该模型由DeepMind和Google Brain合作开发,这两者已合并为Google DeepMind。与许多其他LLM不同,Gemini不仅基于文本训练,还基于多种数据类型训练,使其天然具有多模态特性。

2023年8月,有报道称Google计划在2023年底前推出Gemini,并雄心勃勃地希望超越OpenAI等竞争对手。开发过程涉及数百名工程师,甚至让Google联合创始人谢尔盖·布林重新出山,他后来被列为核心贡献者。法律团队参与过滤训练数据中的受版权保护材料,特别是YouTube视频的转录内容。

首个Gemini 1.0模型于2023年12月6日发布,包含三个变体:Ultra、Pro和Nano。Gemini Ultra被誉为最强大的版本,在MMLU基准测试中以90%的得分超越了人类专家。后续更新包括2024年2月的Gemini 1.5,引入了更大的一百万令牌上下文窗口,以及2024年12月的Gemini 2.0 Flash Experimental,支持实时音频和视频交互。

2025年11月发布

Gemini 3上下文发布于2025年11月举行,Google DeepMind在虚拟新闻发布会上展示了新模型。头条功能是1M令牌上下文窗口,使Gemini 3能够处理前所未有的长文档。这一能力面向处理大规模文本数据的企业用户、研究人员和开发者,例如法律文件、科学论文和技术手册。

在发布期间,Google强调Gemini 3旨在以高准确性和连贯性处理长格式内容,解决了早期模型在处理超长输入时的局限性。该模型通过Google Cloud的Vertex AI和AI Studio平台提供,并集成到Gemini聊天机器人及其他Google产品中。

技术规格

Gemini 3是一款基于大型语言模型架构的模型,类似于其他最先进的LLM。它采用混合专家方法,使模型能够为每项任务仅激活其神经网络的相关部分,从而提高效率和性能。1M令牌上下文窗口是一项重大的技术成就,需要先进的记忆管理和注意力机制。

该模型在Google的张量处理单元(TPU)上训练,这些是为机器学习工作负载定制的芯片。这一训练基础设施能够处理包括文本、图像、音频和视频在内的大规模数据集,从而增强了Gemini 3的多模态能力。

应用与用例

Gemini 3扩展的上下文窗口为各个领域开辟了新的可能性。在法律和合规领域,该模型可以一次性分析整个合同或监管文件,识别关键条款和潜在问题。在学术研究中,它可以总结和综合数百篇论文的发现,辅助文献综述。对于软件开发,Gemini 3可以处理整个代码库,提供上下文感知的建议和调试辅助。

Google还强调了该模型在客户支持中的潜力,它可以处理长对话历史,以及在内容创作中,它可以在长文档中保持连贯性。该模型的多模态特性使其能够将文本与视觉和音频数据结合,实现更丰富的交互。

市场与竞争背景

Gemini 3的发布发生在AI行业竞争激烈的背景下。竞争对手如OpenAI的GPT-4和Anthropic的Claude一直在不断改进其模型。1M令牌上下文窗口为Gemini 3在长文档任务中提供了竞争优势,这是当时其他模型尚未完全解决的细分领域。

Google的策略涉及将Gemini 3集成到其生态系统中,包括搜索、广告、Chrome和Workspace,与之前的Gemini模型类似。公司还通过API向开发者提供该模型,鼓励第三方创新。

反响与影响

对Gemini 3的初步反响是积极的,早期采用者称赞其在处理长文档时不会丢失上下文的能力。然而,一些专家指出,1M令牌窗口虽然令人印象深刻,但需要大量的计算资源,可能限制其可访问性。截至发布时,该模型仅提供英语版本,并计划扩展更广泛的语言支持。

此次发布巩固了Google在AI研发领域的领先地位。它也引发了关于上下文窗口未来的讨论,竞争对手可能会以类似能力作出回应。

未来方向

发布后,Google DeepMind表示计划根据用户反馈完善Gemini 3,并探索效率和准确性的进一步改进。公司还暗示将Gemini 3与其他技术(如机器人技术)集成,以实现物理世界交互,呼应了德米斯·哈萨比斯早前的声明。

Gemini 3的开发是AI领域向更大上下文窗口和更强多模态模型发展的更广泛趋势的一部分。随着该领域的发展,像Gemini 3这样的模型预计将在推进机器学习深度学习应用方面发挥关键作用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·google-deepmind·large-language-model·technology-launch
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史