Gemini是由Google的子公司Google DeepMind开发的一系列多模态大型语言模型(LLM)。它于2023年12月6日发布,是Google早期模型LaMDA和PaLM 2的继任者。Gemini旨在同时处理多种类型的数据,包括文本、图像、音频、视频和计算机代码,这使其区别于许多仅支持文本的LLM。其名称Gemini指的是黄道星座,同时也暗指Google Brain与DeepMind的合并,以及NASA的双子座计划。
此次发布推出了三个模型层级:Gemini Ultra,面向高度复杂的任务;Gemini Pro,适用于广泛的任务;以及Gemini Nano,针对设备端任务进行了优化。发布时,Gemini Pro已集成到Google的Bard聊天机器人中,而Gemini Nano则为Pixel 8 Pro智能手机的功能提供支持。Gemini Ultra计划于2024年初以“Bard Advanced”的名称发布。这些模型最初仅提供英语版本,Google表示在更广泛部署之前需要进行大量的安全测试。
开发
Google于2023年5月10日在Google I/O主题演讲中首次宣布了Gemini,CEO桑达尔·皮查伊将其描述为PaLM 2的更强大继任者,PaLM 2也在该活动中发布。与典型的LLM不同,Gemini从一开始就被设计为多模态系统,能够理解和生成文本、图像、音频、视频和代码。其开发是DeepMind与Google Brain之间的合作,这两者于当年早些时候合并为Google DeepMind。
DeepMind CEO戴密斯·哈萨比斯强调了Gemini超越OpenAI的ChatGPT(基于GPT-4)的潜力。他将其与AlphaGo(2016年击败围棋冠军李世石的DeepMind程序)进行了类比,暗示Gemini将结合AlphaGo的优势与先进的语言能力。2023年8月,《The Information》报道称,Google的目标是在2023年底发布,并计划集成图像生成和其他多模态功能以超越竞争对手。
Google联合创始人谢尔盖·布林被召回协助Gemini的开发,并被誉为“核心贡献者”。来自Google Brain和DeepMind的数百名工程师参与了该项目。由于Gemini使用了YouTube视频的转录内容进行训练,律师参与了过滤可能受版权保护的材料的工作。
发布与初始版本
2023年12月6日,皮查伊和哈萨比斯在虚拟新闻发布会上宣布了Gemini 1.0。其三层结构被揭晓:Ultra用于复杂任务,Pro用于一般任务,Nano用于设备端应用。发布时,Gemini Pro已集成到Bard中,Gemini Nano则嵌入Pixel 8 Pro。Gemini Ultra计划于2024年初推出,为“Bard Advanced”提供支持,并向开发者开放。Google打算将Gemini整合到搜索、广告、Chrome、Google Workspace上的Duet AI以及AlphaCode 2中。
Gemini在Google的张量处理单元(TPU)上进行了训练。Google将其宣传为“最大、最强大的AI模型”,旨在模拟人类行为。该公司表示,由于安全测试要求,Gemini在次年之前不会广泛可用。根据美国总统乔·拜登于2023年10月签署的行政命令,Google同意与联邦政府分享Gemini Ultra的测试结果。与英国政府的讨论也旨在与11月布莱切利公园AI安全峰会的原则保持一致。
据报道,Gemini Ultra在行业基准测试中优于GPT-4、Anthropic的Claude 2、Inflection AI的Inflection-2、Meta的LLaMA 2和xAI的Grok 1。Gemini Pro据称优于GPT-3.5。Gemini Ultra是首个在57个主题的大规模多任务语言理解(MMLU)测试中超越人类专家的语言模型,得分达到90%。Gemini Pro于2023年12月13日通过AI Studio和Vertex AI向Google Cloud客户提供。
集成与扩展
2024年1月,Google与三星合作,将Gemini Nano和Gemini Pro集成到Galaxy S24智能手机系列中。次月,Bard和Duet AI统一到Gemini品牌下,并通过Google One的新“AI Premium”层级推出了“Gemini Advanced with Ultra 1.0”。Gemini Pro也获得了全球发布。
2024年2月,Google推出了Gemini 1.5,据称比1.0 Ultra更强大,具有新架构、专家混合方法和一百万个token的上下文窗口。同月,Google发布了Gemma,这是一个更小、开源的Gemini模型系列,被视为对Meta和其他公司开源其AI模型的回应。
在2024年5月14日的Google I/O主题演讲中,Google宣布了Gemini 1.5 Flash,这是一个更快、更高效的模型。还透露了计划,将桌面优化的Gemini Nano构建集成到Google Chrome浏览器中,通过其“内置AI”架构,通过实验性API(如Prompt API(“window.ai”))向Web开发者暴露本地处理能力。
后续更新
两个更新模型Gemini-1.5-Pro-002和Gemini-1.5-Flash-002于2024年9月24日发布。2024年12月11日,Google宣布了Gemini 2.0 Flash Experimental,具有多模态实时API,用于实时音频和视频交互、原生图像生成、带水印的可控文本转语音,以及集成的Google搜索。
2025年6月,Google推出了Gemini CLI,这是一个开源AI代理,将Gemini的能力带到终端,提供编码、自动化和问题解决功能,并为个人开发者提供慷慨的免费使用限制。
技术架构与能力
Gemini建立在Transformer (architecture)架构之上,类似于其他现代Large language model。它采用Multi-Head Attention机制和Positional Encoding来处理序列数据。该模型是多模态的,在多种数据类型上进行训练,并使用Google的TPU进行训练和推理。Gemini的设计融入了Mixture of experts(在后续版本中)等技术,并支持大上下文窗口,使其能够处理长文档和复杂推理任务。
Gemini的能力包括自然语言理解、代码生成、图像和音频处理,以及与外部工具的集成。该模型旨在适应各种领域,从Bard等消费应用,到Google Cloud上的企业解决方案。
影响与反响
Gemini的发布加剧了Generative AI领域的竞争,特别是与OpenAI的GPT-4和Anthropic的Claude模型。Google将Gemini定位为这些系统的直接挑战者,利用其与Google生态系统(包括搜索、Workspace和Cloud)的深度集成。该模型的多模态特性被视为迈向更类人AI的重要一步,哈萨比斯暗示将Gemini与机器人技术结合用于物理交互,这具有潜在应用。
行业分析师注意到Gemini在MMLU等基准测试中的强劲表现,但也提出了对安全性、偏见以及训练大型模型的环境影响的担忧。Google开源Gemma的决定被视为促进社区采用和回应专有AI批评的战略举措。
未来方向
Google继续发展Gemini,进行持续更新和发布新模型版本。将Gemini集成到Chrome和Android设备中,旨在将设备端AI带给广泛受众。Gemini CLI和其他工具的开发表明其专注于开发者中心应用。截至2025年,Gemini仍是Google AI战略的核心部分,与该领域的其他主要参与者竞争。