Gemini(语言模型)

译自英文

Gemini是Google DeepMind推出的多模态大型语言模型系列,于2023年12月6日发布,接替了LaMDA和PaLM 2。它为Gemini聊天机器人提供支持,并包含Pro、Flash和Nano等模型。

Gemini是谷歌子公司Google DeepMind开发的一系列多模态大型语言模型(LLM)。它是谷歌早期模型LaMDA和PaLM 2的继任者。Gemini系列包括多个变体,如Gemini Pro、Gemini Deep Think、Gemini Flash和Gemini Flash Lite,并为Gemini聊天机器人提供支持。Gemini这一名称既指双子星座,也暗指Google Brain与DeepMind的合并,以及美国国家航空航天局的双子座计划。Gemini于2023年12月6日发布,旨在同时处理多种数据类型,包括文本、图像、音频、视频和计算机代码,这使其区别于许多仅处理文本的前代模型。

Gemini的开发标志着谷歌在生成式人工智能领域竞争中的重要一步,尤其是针对OpenAI的GPT-4和其他大型语言模型。谷歌将Gemini定位为其“最大、最强大的人工智能模型”,其能力不仅限于文本生成,还包括图像理解和生成,以及潜在的机器人技术集成。该模型在谷歌的张量处理单元(TPU)上训练,最初仅支持英语,并在谷歌产品和服务中分阶段推出。

开发

谷歌于2023年5月10日在Google I/O主题演讲中首次宣布了Gemini,首席执行官桑达尔·皮查伊将其描述为PaLM 2的更强大继任者,PaLM 2也在该活动中发布。当时,Gemini仍处于早期开发阶段,但其多模态设计已引人注目,这使其区别于许多主要依赖文本语料库的现有LLM。该模型由DeepMind和Google Brain合作开发,这两个人工智能研究团队于2023年4月合并为Google DeepMind。

DeepMind首席执行官戴密斯·哈萨比斯在接受《连线》杂志采访时强调了Gemini的潜力,暗示它可能超越运行在GPT-4上的OpenAI ChatGPT。哈萨比斯借鉴了DeepMind在AlphaGo方面的经验,AlphaGo是2016年击败围棋冠军李世石的程序,并表示Gemini将结合AlphaGo的优势与其他Google DeepMind LLM。2023年8月,《The Information》报道称,谷歌计划在2023年底前推出Gemini,并计划将对话式文本功能与人工智能驱动的图像生成相结合,从而实现情境化图像创建和更广泛的用例。

谷歌联合创始人谢尔盖·布林被召回协助Gemini的开发,与Google Brain和DeepMind的数百名工程师一起工作。布林后来被列为该项目的“核心贡献者”。由于Gemini是在YouTube视频转录文本上训练的,谷歌聘请了律师来过滤可能受版权保护的材料。开发过程还涉及广泛的安全测试,因为谷歌表示Gemini要到2024年才会广泛发布,以确保负责任地部署。

为应对Gemini即将发布,OpenAI加速了将多模态功能集成到GPT-4中的工作。到2023年9月,多家公司已获得早期版本Gemini的访问权限,谷歌计划通过Google Cloud的Vertex AI服务提供该模型。该模型还被定位为在编码助手领域与微软的GitHub Copilot竞争。

发布

2023年12月6日,桑达尔·皮查伊和戴密斯·哈萨比斯在一次虚拟新闻发布会上宣布了“Gemini 1.0”。初始版本包括三个模型:Gemini Ultra,专为“高度复杂的任务”设计;Gemini Pro,适用于“广泛的任务”;以及Gemini Nano,用于“设备端任务”。发布时,Gemini Pro和Nano分别集成到Bard(谷歌的聊天机器人)和Pixel 8 Pro智能手机中。Gemini Ultra计划为“Bard Advanced”提供支持,并于2024年初向开发者开放。谷歌还计划将Gemini整合到搜索、广告、Chrome、Google Workspace上的Duet AI以及AlphaCode 2中。

Gemini最初仅支持英语。谷歌将其宣传为“最大、最强大的人工智能模型”,旨在模拟人类行为。该公司强调,由于需要进行“广泛的安全测试”,Gemini要到次年才会广泛可用。Gemini在谷歌的TPU上训练并由其提供支持,其名称既指DeepMind与Google Brain的合并,也指美国国家航空航天局的双子座计划。

据报道,Gemini Ultra在各种行业基准测试中表现优于多个竞争模型,包括GPT-4、Anthropic的Claude 2、Inflection AI的Inflection-2、Meta的LLaMA 2和xAI的Grok 1。Gemini Pro据称表现优于GPT-3.5。值得注意的是,Gemini Ultra是第一个在57个主题的大规模多任务语言理解(MMLU)测试中超越人类专家的语言模型,得分达到90%。Gemini Pro于2023年12月13日在AI Studio和Vertex AI上向Google Cloud客户开放,Gemini Nano随后向Android开发者开放。

哈萨比斯还透露,DeepMind正在探索如何将Gemini与机器人技术相结合,以实现与世界的物理交互。根据美国总统乔·拜登于2023年10月签署的行政命令,谷歌表示将与美国联邦政府共享Gemini Ultra的测试结果。同样,谷歌与英国政府进行了接触,以符合2023年11月在布莱切利公园举行的人工智能安全峰会所确立的原则。

2025年6月,谷歌推出了Gemini CLI,这是一个开源人工智能代理,将Gemini的功能引入终端,提供编码、自动化和问题解决功能,并为个人开发者提供慷慨的免费使用额度。

更新

2024年1月,谷歌与三星合作,将Gemini Nano和Gemini Pro集成到Galaxy S24智能手机系列中。次月,Bard和Duet AI统一到Gemini品牌下,并通过Google One订阅服务的新“AI Premium”层级发布了“Gemini Advanced with Ultra 1.0”。Gemini Pro也实现了全球发布。

2024年2月,谷歌推出了Gemini 1.5,称其比1.0 Ultra更强大、能力更强。变化包括新的架构、专家混合方法以及更大的100万token上下文窗口。同月,谷歌推出了Gemma,这是一个更小、免费且开源的Gemini模型系列。多家媒体将其描述为对Meta等公司开源其人工智能模型的回应,并标志着谷歌此前保持其人工智能专有做法的逆转。

谷歌于2024年5月14日在Google I/O主题演讲中宣布了另一个模型Gemini 1.5 Flash。在同一活动中,谷歌宣布计划通过其“Built-in AI”架构将桌面优化的Gemini Nano构建直接集成到Google Chrome浏览器中,通过实验性API(如Prompt API(“window.ai”))向Web开发者开放本地处理能力。

两个更新的Gemini模型Gemini-1.5-Pro-002和Gemini-1.5-Flash-002于2024年9月24日发布。

2024年12月11日,谷歌宣布了新的Gemini 2.0 Flash Experimental模型。其功能包括用于实时音频和视频交互的多模态实时API、原生图像和可控文本到语音生成(带水印),以及集成的Google搜索。它还引入了推理和编码能力的改进。

架构与训练

Gemini基于Transformer (architecture)架构构建,这是许多现代Large language model的基础。该模型在后期版本中采用专家混合方法,通过仅为每个任务激活相关子网络来实现高效扩展。训练涉及大规模数据集,包括文本、图像、音频、视频和代码,来源包括YouTube转录文本等各类存储库,这需要仔细过滤以符合版权要求。

该模型在谷歌的TPU上训练,TPU是定制的Artificial intelligence加速器。这一基础设施使Gemini能够处理大规模训练运行,有助于其在MMLU等基准测试中的表现。多模态训练方法使Gemini能够跨不同模态处理和生成内容,使其在从文本生成到图像理解等应用中具有多功能性。

能力与表现

Gemini的能力涵盖多个领域。它可以执行复杂的推理任务、生成代码、理解和生成图像,以及处理音频和视频。该模型在行业基准测试中的表现是一个关键卖点。Gemini Ultra在MMLU上取得90%的得分,超越了人类专家,这是一个显著成就,凸显了其在57个主题上的广泛知识。

除了基准测试,Gemini已集成到谷歌的各种产品中,包括搜索、广告和Chrome,增强了其人工智能驱动的功能。该模型处理长上下文窗口的能力(Gemini 1.5中可达100万token)使其能够处理大型文档或整个代码库,这对开发者和研究人员非常有用。

集成与生态系统

Gemini集成到谷歌的云服务中,包括Google Cloud和Vertex AI,使企业能够访问其功能。它还支持Gemini聊天机器人,该机器人在2024年2月从Bard更名而来。该模型通过Gemini Nano在Android设备上的可用性,实现了设备端人工智能处理,这对隐私和延迟敏感的应用非常重要。

谷歌还通过合作伙伴关系提供Gemini,例如与Samsung Electronics合作用于Galaxy S24,以及通过开源发布如Gemma,这些是更小、更易访问的模型。2025年推出的Gemini CLI为开发者提供了命令行界面,进一步扩展了其生态系统。

反响与影响

Gemini因其多模态能力和强大的基准测试表现而受到人工智能社区的好评。然而,它也面临关于安全性、版权问题以及训练大型模型对环境影响的审查。谷歌决定与政府共享测试结果,反映了对人工智能监管和安全更广泛的关注。

Gemini的发布加剧了人工智能行业的竞争,促使OpenAIAnthropic等竞争对手加速自身发展。Gemini集成到谷歌产品中也引发了关于市场主导地位和人工智能部署伦理影响的质疑。

未来方向

谷歌继续迭代Gemini,像Gemini 2.0 Flash Experimental这样的更新表明其关注实时交互和多模态生成。机器人技术集成的探索暗示了物理人工智能系统中的潜在应用。截至2025年,Gemini预计将进一步发展,持续研究改进推理、效率和安全性。

Gemini的开发也与Generative AI的更广泛趋势相一致,其中模型变得更加多模态,并能够处理复杂任务。谷歌对TPU的投资以及与Broadcom在定制芯片上的合作,凸显了其推进人工智能基础设施的承诺。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·large-language-models·google-deepmind·multimodal-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史