Gemini是谷歌子公司Google DeepMind开发的一系列多模态大型语言模型(LLM)。它于2023年12月6日发布,是谷歌早期模型LaMDA和PaLM 2的继任者。该模型系列包括Gemini Pro、Gemini Deep Think、Gemini Flash和Gemini Flash Lite,并为Gemini聊天机器人提供支持。其名称源自双子座星座,象征着该项目融合了Google Brain和DeepMind的双重特性。Gemini设计用于同时处理多种数据类型,包括文本、图像、音频、视频和计算机代码,这使其区别于许多仅支持文本的前代模型。
开发背景
谷歌于2023年5月10日在Google I/O主题演讲中首次宣布Gemini,将其定位为同场活动中发布的PaLM 2的更强大继任者。谷歌首席执行官桑达尔·皮查伊表示,Gemini仍处于早期开发阶段。与仅基于文本语料库训练的典型大型语言模型不同,Gemini从一开始就被设计为多模态模型,能够同时处理多种输入类型。其开发是DeepMind和Google Brain两个部门合作的结果,这两个部门后来合并为Google DeepMind。
在接受《连线》杂志采访时,DeepMind首席执行官德米斯·哈萨比斯盛赞Gemini的先进能力,称其将超越运行在GPT-4上的OpenAI ChatGPT。哈萨比斯强调了DeepMind的AlphaGo项目的优势,该项目在2016年击败围棋冠军李世石后引起全球关注,并表示Gemini将结合AlphaGo的力量与其他Google–DeepMind LLM。这一雄心反映了谷歌对ChatGPT及其早期Bard聊天机器人日益增长的受欢迎程度的积极回应。
2023年8月,《信息》杂志发布了一份报告,概述了谷歌的Gemini路线图,揭示了2023年底的目标发布日期。报告指出,谷歌希望通过结合对话文本能力与人工智能驱动的图像生成,实现上下文相关图像和更广泛的用例,从而超越OpenAI和其他竞争对手。谷歌联合创始人谢尔盖·布林被召回协助开发,与Google Brain和DeepMind的数百名工程师一起工作;他后来被列为“核心贡献者”。由于Gemini基于YouTube视频转录内容进行训练,谷歌聘请了律师来过滤可能受版权保护的材料。
发布与初始模型
2023年12月6日,皮查伊和哈萨比斯在一次虚拟新闻发布会上宣布了“Gemini 1.0”。此次发布包含三个模型:Gemini Ultra,专为“高度复杂任务”设计;Gemini Pro,用于“广泛任务”;以及Gemini Nano,用于“设备端任务”。发布时,Gemini Pro和Nano分别集成到Bard和Pixel 8 Pro智能手机中。Gemini Ultra将用于驱动“Bard Advanced”,并于2024年初向软件开发人员开放。其他计划集成的产品包括搜索、广告、Chrome、Google Workspace上的Duet AI以及AlphaCode 2。初始版本仅提供英语版本。
谷歌将Gemini宣传为其“最大、最强大的AI模型”,旨在模拟人类行为。该公司表示,由于需要进行“广泛的安全测试”,Gemini要到下一年才会广泛开放。Gemini基于谷歌的张量处理单元(TPU)进行训练和运行。该名称还参考了NASA的双子座计划,反映了DeepMind和Google Brain的合并。
性能与基准测试
据报道,Gemini Ultra在各种行业基准测试中超越了GPT-4、Anthropic的Claude 2、Inflection AI的Inflection-2、Meta的LLaMA 2以及xAI的Grok 1。Gemini Pro据称超越了GPT-3.5。值得注意的是,Gemini Ultra是首个在57个主题的大规模多任务语言理解(MMLU)测试中超越人类专家的语言模型,得分达到90%。这一基准结果使Gemini成为Artificial intelligence和Large language model研究领域的领先模型。
Gemini Pro于2023年12月13日在AI Studio和Vertex AI上向谷歌云客户开放。Gemini Nano随后向Android开发人员开放。哈萨比斯进一步透露,DeepMind正在探索如何将Gemini与机器人技术结合,以实现与物理世界的交互。根据美国总统乔·拜登于2023年10月签署的行政命令,谷歌表示将与美国联邦政府共享Gemini Ultra的测试结果。同样,该公司与英国政府进行了讨论,以遵守2023年11月在布莱切利公园举行的AI安全峰会所提出的原则。
与谷歌产品的集成
发布后,Gemini迅速集成到谷歌的生态系统中。2024年1月,谷歌与三星合作,将Gemini Nano和Gemini Pro集成到Galaxy S24智能手机系列中。次月,Bard和Duet AI统一到Gemini品牌下,并通过Google One订阅服务的新“AI Premium”层级发布了“Gemini Advanced with Ultra 1.0”。Gemini Pro也进行了全球发布,扩展到其最初的仅英语版本之外。
2024年2月,谷歌发布了Gemini 1.5,称其比1.0 Ultra更强大、更先进。变化包括新的架构、专家混合方法以及更大的百万级token上下文窗口。同月,谷歌推出了Gemma,这是一个更小、免费且开源的Gemini模型系列。多家媒体将其描述为对Meta和其他公司开源其AI模型的回应,以及谷歌此前保持其AI专有做法的逆转。
谷歌于5月14日在2024年I/O主题演讲中宣布了另一款模型Gemini 1.5 Flash。在同一活动中,谷歌宣布计划通过其“Built-in AI”架构将桌面优化的Gemini Nano构建直接集成到Google Chrome浏览器中,通过实验性API(如Prompt API(“window.ai”))向Web开发人员开放本地处理能力。
后续更新与模型
两个更新的Gemini模型Gemini-1.5-Pro-002和Gemini-1.5-Flash-002于2024年9月24日发布。2024年12月11日,谷歌宣布了新的Gemini 2.0 Flash Experimental模型。其功能包括用于实时音频和视频交互的多模态Live API、原生图像和可控文本到语音生成(带水印)以及集成的Google搜索。这一迭代继续推动了多模态AI能力的边界。
2025年6月,谷歌推出了Gemini CLI,这是一个开源AI代理,将Gemini的功能直接带到终端,提供高级编码、自动化和问题解决功能,并为个人开发人员提供慷慨的免费使用限制。此举凸显了谷歌对开发人员可访问性和开源工具的承诺。
竞争定位
Gemini的发布是Generative AI竞争格局中的一个重要事件。谷歌将Gemini直接定位为与OpenAI、Anthropic和其他AI研究组织的模型竞争。该模型的多模态能力和强劲的基准性能旨在挑战GPT-4和其他领先LLM的主导地位。谷歌将Gemini集成到其庞大的产品生态系统中,包括搜索、Workspace和Android,这提供了相对于竞争对手的分发优势。
Gemini的开发还涉及与硬件合作伙伴的合作。与三星Galaxy S24的集成凸显了设备端AI的重要性,而谷歌TPU的使用则强调了专用硬件在训练大型模型中的作用。竞争动态扩展到云服务,Gemini Pro在Google Cloud的Vertex AI上可用,与Amazon Web Services和Microsoft Azure的产品竞争。
技术架构与研究
Gemini的架构建立在Deep learning和Transformer (architecture)模型的进步之上。作为多模态模型,它结合了Multi-Head Attention和Cross-Attention的技术,以处理和关联不同模态的信息。Gemini 1.5中的专家混合方法允许更高效的扩展,仅激活网络中与给定任务相关的部分。该模型的训练可能涉及Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)和Curriculum Learning等技术,以提高性能和一致性。
Gemini背后的研究借鉴了更广泛的Machine learning领域,包括MIT CSAIL、Stanford AI Lab和BAIR (Berkeley AI Research)等机构的贡献。Google DeepMind的传统,包括AlphaGo项目,影响了模型的设计,特别是其处理复杂、多步骤推理任务的能力。开发还涉及德米斯·哈萨比斯和AI社区其他关键人物等研究人员。
安全与治理
谷歌强调了对Gemini的安全测试,推迟广泛可用性以进行广泛评估。该公司承诺在2023年10月关于AI的行政命令后,与美国联邦政府共享测试结果。与英国政府的讨论旨在与布莱切利公园AI安全峰会提出的原则保持一致。这些步骤反映了对Artificial intelligence日益增长的监管审查以及负责任部署强大模型的需求。
将Gemini集成到Pixel 8 Pro和Galaxy S24等消费产品中,引发了关于隐私和设备端处理的问题。Gemini Nano的本地处理能力旨在最小化数据传输,解决了一些隐私问题。然而,多模态AI的更广泛部署继续引发关于道德使用和潜在社会影响的辩论。
未来方向
截至2025年,Gemini继续通过新模型和功能发展。Gemini CLI和开源Gemma模型的推出表明了一种扩大AI能力访问范围的策略。谷歌对Google DeepMind的持续投资及其与Google Cloud的集成表明,Gemini将继续成为该公司AI战略的核心支柱。未来的发展可能包括推理能力的进一步改进、更高效的架构以及更深入地集成机器人和物理系统,正如哈萨比斯关于将Gemini与机器人技术结合的评论所暗示的那样。
竞争格局仍然充满活力,OpenAI和Anthropic继续发布先进模型。Gemini的成功将取决于其保持性能领先、扩展多模态能力以及应对复杂AI监管和道德环境的能力。该模型的名称唤起了星座的双重特性,恰当地捕捉了该项目将多样化AI能力统一到一个强大系统中的雄心。