## Gemini Gemini 是 Google 开发的一系列大型语言模型(LLM),于 2023 年 12 月首次发布。它由 Google DeepMind 构建,旨在成为多模态模型,能够理解和处理文本、图像、音频和视频。Gemini 模型是 Google 对 OpenAI 的 GPT-4 等竞争模型的直接回应,并已集成到 Google 的多种产品中,包括 Bard(现为 Gemini 聊天

译自英文

Google DeepMind推出的原生多模态大语言模型系列,于2023年12月发布,作为Bard和PaLM的继任者,涵盖Ultra、Pro、Flash和Nano四个层级,支持文本、图像、音频和视频处理。

Gemini是谷歌DeepMind旗舰级大语言模型系列,于2023年12月6日发布。它取代了谷歌此前基于PaLM的Bard聊天机器人,成为公司主要的语言模型系列,并从一开始就被设计为原生多模态,联合训练文本、图像、音频和视频,而非在纯文本预训练后再附加模态。

背景

Gemini的开发紧随2023年Google Brain与DeepMind合并为统一的Google DeepMind组织之后,这一重组被广泛报道为对前一年ChatGPT发布所带来的竞争压力的回应,有时在内部被描述为谷歌搜索和AI战略的“红色警戒”时刻。Demis Hassabis领导了合并后的组织,而谷歌首席执行官Sundar Pichai则公开倡导围绕Gemini将公司产品线重新定位为“AI优先”。

模型层级与发布

Gemini已按多个规模层级发布,以满足不同使用场景:Ultra用于要求最高的任务,Pro作为均衡的通用模型,Flash作为更快更便宜的高吞吐量应用选项,Nano则用于手机及其他受限硬件上的设备端使用。后续版本(1.0、1.5、2.0及更高版本)扩展了模型的上下文窗口,其中1.5 Pro尤其以支持约百万token的超长上下文窗口著称,使得在单次提示中理解整个代码库、长文档或完整视频文件等任务成为可能。后来版本引入了显式推理模式,在推理时分配额外计算资源,使Gemini与由OpenAI o1等系统引领的推理模型的更广泛趋势保持一致。

Gemini模型的训练在很大程度上使用了谷歌自家的张量处理单元(TPU),而非完全依赖第三方GPU,这反映了谷歌在定制AI加速器硬件方面的长期投入。

集成与产品

谷歌将Gemini广泛集成到其产品生态系统中,包括搜索(通过AI概览)、Workspace应用、Android操作系统以及一个重新命名的消费级助手应用。基于Gemini系列构建的专门能力包括图像生成和编辑工具,最引人注目的是社区昵称为Nano Banana的模型,以及Veo视频生成模型,两者均在Google DeepMind内部开发,并常被整合到更广泛的Gemini产品界面中。Gemini还为NotebookLM提供支持,这是一款研究和笔记助手,因其AI生成的“音频概览”播客功能而备受关注。

接受度与竞争

Gemini与OpenAI的GPT系列和Anthropic的Claude直接竞争,在基准测试和社区评估平台(如LMArena)上的相对排名随版本发布而有所变化。最初Gemini发布的早期反响褒贬不一,一些营销演示后来被批评为不完全代表真实模型能力,而后续版本,尤其是2.0及其后发布,则更广泛地被认为在缩小或领先于竞争对手实验室的能力差距。Gemini在谷歌搜索和消费产品中的深度集成使其成为按用户覆盖范围最为广泛分布的AI模型系列之一,即便它并不总是在原始基准性能上领先,其发展轨迹也一直被视为判断谷歌能否将基础设施和分发优势转化为持续AI领导地位的重要指标。

分类:large-language-models·google-models·multimodal-ai
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史