Gemini 1 是一个多模态大型语言模型家族,由Google DeepMind开发,于2023年12月6日宣布,作为LaMDA和PaLM 2的继任者。它包含三个初始模型:Gemini Ultra,专为高度复杂的任务设计;Gemini Pro,适用于广泛的任务;以及Gemini Nano,用于设备端任务。该家族为Gemini聊天机器人提供支持,并以双子星座命名,反映了Google Brain与DeepMind的合并。与仅处理文本的前代模型不同,Gemini经过训练可同时处理文本、图像、音频、视频和计算机代码,使其成为OpenAI的GPT-4及其他生成式AI系统的直接竞争对手。
此次发布标志着人工智能发展的关键时刻,因为Gemini Ultra成为首个在57个学科的Massive Multitask Language Understanding(MMLU)测试中超越人类专家的模型,得分达到90%。Google将其誉为“最大、最强大的AI模型”,其能力涵盖机器学习、深度学习和神经网络架构。
开发背景
Google首次在2023年5月10日的Google I/O主题演讲中宣布了Gemini,首席执行官Sundar Pichai称其仍处于早期开发阶段。该模型由DeepMind和Google Brain合作构建,两者已在Google DeepMind旗下合并。DeepMind首席执行官Demis Hassabis在采访中强调,Gemini将结合对话式文本能力与AI驱动的图像生成,借鉴了DeepMind的AlphaGo程序在2016年获得全球关注的优势。
开发涉及数百名工程师,Google联合创始人Sergey Brin被召回协助,后来被誉为“核心贡献者”。该模型使用YouTube视频的转录文本进行训练,律师对可能受版权保护的材料进行了筛选。到2023年8月,有报道称目标发布时间为2023年底,并通过Google Cloud的Vertex AI服务向选定的公司提供早期访问。
发布与初始模型
2023年12月6日,Pichai和Hassabis在虚拟新闻发布会上宣布了“Gemini 1.0”。发布时,Gemini Pro和Nano分别集成到Bard和Pixel 8 Pro智能手机中,而Gemini Ultra计划于2024年初用于“Bard Advanced”和开发者使用。该模型最初仅提供英文版本,Google称需要“广泛的安全测试”后才能更广泛发布。
Gemini使用Google的张量处理单元(TPU)进行训练。据报道,Gemini Ultra在行业基准测试中优于GPT-4、Anthropic的Claude 2、Inflection AI的Inflection-2、Meta的LLaMA 2和xAI的Grok 1,而Gemini Pro则优于GPT-3.5。Gemini Pro于2023年12月13日在AI Studio和Vertex AI上向Google Cloud客户开放。根据2023年10月美国行政命令,Google与联邦政府分享了测试结果,并与英国政府就Bletchley Park峰会上的AI安全原则进行了接触。
技术架构与能力
Gemini的架构利用了Transformer模型,结合了多头注意力和位置编码机制。其多模态设计允许同时处理不同类型的数据,这与仅处理文本的LLM不同。该模型集成了基于AI反馈的强化学习和温度缩放等技术来控制输出,并使用top-k采样和top-p采样来增加生成多样性。
模型的训练采用了Adam优化器变体、学习率调度和梯度裁剪来稳定深度学习过程。批归一化和dropout用于改善泛化能力,而模型剪枝则帮助优化效率,以便在Gemini Nano中进行设备端部署。
更新与扩展
2024年1月,Google与三星电子合作,将Gemini Nano和Pro集成到Galaxy S24智能手机系列中。次月,Bard和Duet AI统一到Gemini品牌下,并通过Google One的新“AI Premium”层级发布了“Gemini Advanced with Ultra 1.0”。Gemini Pro在全球范围内推出。
2024年2月,Google推出了Gemini 1.5,采用新架构、专家混合方法以及一百万token的上下文窗口。同月,Google发布了Gemma,这是一个更小、免费且开源的Gemini模型系列,被描述为对Meta开源做法的回应。Gemini 1.5 Flash于2024年5月14日在I/O主题演讲中宣布,并计划通过其“Built-in AI”架构将Gemini Nano集成到Google Chrome中。更新模型Gemini-1.5-Pro-002和Gemini-1.5-Flash-002于2024年9月24日发布。
影响与遗产
Gemini 1确立了Google DeepMind在生成式AI领域的领先地位,与OpenAI和Anthropic直接竞争。其多模态方法影响了行业后续模型的发展,包括Amazon Web Services和Microsoft Azure在云AI服务方面的努力。该模型集成到Pixel智能手机和三星设备等消费产品中,扩大了AI的可及性,而其开源的Gemma模型则为更广泛的AI研究社区做出了贡献。
此次发布还引发了监管讨论,Google与美国和英国政府就安全测试进行了接触。截至2025年,Gemini已通过多个版本演变,Gemini 2.0于2024年12月宣布,但Gemini 1作为基础性发布仍然具有重要意义,它证明了大规模多模态AI系统的可行性。