Google Gemini,前身为Bard,是由Google开发的生成式人工智能聊天机器人和虚拟助手。它由同名的大语言模型(LLM)家族提供支持,此前基于LaMDA和PaLM 2。Gemini架构原生地基于多种数据类型进行训练,使模型能够同时处理和生成文本、计算机代码、图像、音频和视频。Google以不同能力级别分发该技术,从高效的设备端版本(“Nano”)和具有成本效益的高吞吐量变体(“Flash”),到专为复杂推理设计的高计算模型(“Pro”和“Ultra”)。1.5和3代模型引入了扩展的上下文窗口,使得能够在单个提示中分析大型数据集,例如整个代码库、长视频或大量文档档案。
Gemini于2023年12月6日首次公布,并取代了Google现有的AI服务品牌。2024年2月,Bard聊天机器人更名为Gemini,Google Cloud和Workspace的“Duet AI”品牌也退役,改用Gemini标识。这些模型通过Gemini移动应用(在Android设备上作为覆盖式助手运行)以及面向第三方开发者的Vertex AI平台,集成到Google生态系统中。
历史
背景
2022年11月,OpenAI推出了ChatGPT,这是一款基于GPT-3大语言模型家族的聊天机器人。ChatGPT获得了全球关注,成为互联网爆红现象。由于担心ChatGPT对Google搜索的潜在威胁,Google高管发布了“红色代码”警报,重新分配多个团队以协助公司的人工智能工作。Google及其母公司Alphabet的首席执行官桑达尔·皮查伊被广泛报道发布了该警报,但皮查伊后来向《纽约时报》否认了这一点。Google联合创始人拉里·佩奇和谢尔盖·布林(他们于2019年卸任Alphabet联合首席执行官职务)罕见地出席了与公司高管的紧急会议,讨论Google对ChatGPT的回应。布林于2023年2月要求访问Google的代码,这是多年来的首次。
Google在2021年早些时候公布了原型LLM LaMDA,但未向公众发布。当员工在全员会议上询问LaMDA是否是Google与ChatGPT竞争的错失机会时,皮查伊和Google AI负责人杰夫·迪恩表示,虽然公司的聊天机器人具有与ChatGPT类似的能力,但引入可能传播虚假信息的LLM存在风险,因此他们决定等待。2023年1月,Google Brain的姊妹公司DeepMind的首席执行官戴密斯·哈萨比斯暗示了推出ChatGPT竞争对手的计划,Google员工被指示加速推进ChatGPT竞争对手的进展,密集测试“Apprentice Bard”和其他聊天机器人。皮查伊在2月份的Google季度收益投资者电话会议上向投资者保证,公司有计划扩大LaMDA的可用性和应用。
Bard
#### 公告
2023年2月6日,Google宣布推出Bard,这是一款由LaMDA驱动的生成式人工智能聊天机器人。Bard首先向选定的10,000名“可信测试者”推出,然后计划在月底广泛发布。该项目由产品负责人杰克·克劳奇克监督,他将该产品描述为“协作式AI服务”而非搜索引擎,而皮查伊详细说明了Bard将如何集成到Google搜索中。路透社计算,到2024年,在Google搜索中添加类似ChatGPT的功能可能使公司额外支出60亿美元,而研究和咨询公司SemiAnalysis计算,这将使Google花费30亿美元。该技术以代号“Atlas”开发,名称“Bard”参考了凯尔特语中讲故事者的术语,并选择它来“反映底层算法的创造性本质”。
多家媒体和金融分析师称Google“仓促”宣布Bard,以先发制人地应对竞争对手微软计划于2月7日举行的活动,该活动将公布其与OpenAI的合作,以Bing AI(后来更名为Microsoft Copilot)的形式将ChatGPT集成到其Bing搜索引擎中,并避免与微软“追赶”。微软首席执行官萨蒂亚·纳德拉告诉The Verge:“我想让人们知道,我们让他们跳舞了。”The Verge的汤姆·沃伦和彭博新闻的戴维·阿尔巴指出,这标志着两家大型科技公司之间关于“搜索的未来”的又一次冲突的开始,此前他们为期六年的“休战”于2021年到期;《卫报》的克里斯·斯托克尔-沃克、Recode的萨拉·莫里森以及投资公司Wedbush Securities的分析师丹·艾夫斯称这是两者之间的人工智能军备竞赛。
在巴黎一场“令人失望”的2月8日直播展示Bard之后,Google股价下跌了8%,相当于市值损失1000亿美元,该直播的YouTube视频也被设为私密。许多观众还指出,在演示过程中出现了一个错误,Bard在回答查询时给出了关于詹姆斯·韦伯太空望远镜的不准确信息。Google员工在公司的内部论坛Memegen上批评了皮查伊对Bard“仓促”和“搞砸了”的公告,而Futurism的玛吉·哈里森称这次推出是“混乱”。皮查伊为自己的行为辩护,称Google“长期以来一直在深入研究AI”,并拒绝接受Bard的发布是膝跳反应的说法。
在巴黎直播一周后,皮查伊要求80,000名员工花两到四个小时在内部测试Bard,而Google高管普拉巴卡尔·拉加万要求他们纠正Bard犯下的任何错误。在接下来的几周里,Google员工在内部消息中批评了Bard,引用安全和道德方面的担忧,并呼吁公司领导不要推出该服务。Google高管不顾其AI伦理团队进行的负面风险评估报告,推出了该产品。在皮查伊当月晚些时候因收入增长放缓突然裁员12,000人后,幸存的员工分享了表情包和与Bard的幽默交流片段,询问其对裁员的“意见”。
技术架构
Gemini模型基于Transformer架构构建,类似于其他大语言模型,但有一个关键区别:它们原生地基于多种数据类型进行训练。这种多模态训练使模型能够同时处理和生成文本、代码、图像、音频和视频,而早期模型则分别处理每种模态。该架构结合了多头注意力和位置编码等技术来处理长序列。1.5和3代模型扩展了上下文窗口,使得能够在单个提示中分析大型数据集,例如整个代码库、长视频或大量文档档案。这是通过减少计算开销的高效注意力机制实现的。
Google以多种变体分发Gemini,以平衡性能和效率。“Nano”变体专为设备端使用而设计,可在移动硬件上高效运行。“Flash”变体针对高吞吐量、成本效益高的任务进行了优化。“Pro”变体处理复杂推理,而“Ultra”变体是用于要求最苛刻应用的最高计算模型。这些变体通过Vertex AI集成到Google的Google Cloud平台中,允许第三方开发者通过API访问这些模型。
集成与可用性
Gemini移动应用在Android设备上作为覆盖式助手运行,在某些能力上取代了之前的Google Assistant。它以Gemini品牌集成到Google Workspace中,包括Gmail、Docs和Sheets。这些模型也可通过Google Cloud的Vertex AI平台获得,该平台为开发者提供了构建和部署AI应用的工具。2024年2月,Bard聊天机器人更名为Gemini,Google Cloud和Workspace的“Duet AI”品牌退役,改用Gemini标识。这次品牌重塑将Google的AI产品统一在一个名称下。
反响与争议
Gemini的发布既带来了技术上的赞誉,也引发了公众争议。评论者指出,该模型在编码和检索任务上的基准测试与OpenAI的GPT-4和GPT-5具有竞争力。然而,产品发布因其输出的可靠性而受到批评。2024年初,在用户报告其描绘人类主体的历史不准确性和偏见后,Google暂停了该模型生成人物图像的能力。后续更新,包括2025年全年发布的Gemini 1.5和3系列,专注于减少幻觉、改善延迟,并增强用于自主研究和软件开发的智能体能力。这些争议凸显了生成式AI在偏见和事实准确性方面持续存在的挑战。