译自英文

PaLM 2是谷歌开发的大型语言模型,于2023年5月在Google I/O大会上宣布。据报道,它拥有3400亿参数,并在3.6万亿个令牌上进行训练,接替了最初的PaLM模型。

PaLM 2 是谷歌开发的大型语言模型(LLM),于2023年5月在年度Google I/O主题演讲中发布。它是Pathways语言模型(PaLM)的继任者,后者是谷歌AI开发的一个拥有5400亿参数的密集解码器专用、基于Transformer的LLM。据报道,PaLM 2是一个拥有3400亿参数的模型,在3.6万亿个令牌上训练,代表了在其前身基础上规模和能力的显著进步。

该模型是谷歌在Generative AILarge language model研究领域更广泛努力的一部分,建立在支撑现代Deep learning系统的Transformer架构之上。PaLM 2是与Google DeepMind共同开发的,反映了谷歌AI研究部门的整合。

架构与能力

PaLM 2遵循其前身确立的解码器专用Transformer设计,利用Multi-Head Attention机制和Positional Encoding来处理序列数据。该模型能够执行广泛的任务,包括常识推理、算术推理、笑话解释、代码生成和翻译。当与思维链提示结合时,PaLM 2在需要多步推理的数据集(如文字题和基于逻辑的问题)上取得了显著更好的性能。

该模型在3.6万亿个令牌上的训练(较原始PaLM使用的7800亿个令牌大幅增加)使其在多个领域表现出增强的性能。这个训练语料库包括过滤后的网页、书籍、维基百科文章、新闻文章、来自开源代码仓库的源代码以及社交媒体对话,其中社交媒体部分占语料库的50%,以支持对话能力。

训练基础设施

原始PaLM 540B在两个TPU v4 Pod上训练,每个Pod有3,072个TPU v4芯片,连接到768台主机,使用模型并行和数据并行的组合进行连接。这种配置总共使用6,144个芯片,创下了该规模LLM最高训练效率的纪录,硬件FLOPs利用率达到57.8%。PaLM 2的训练基础设施遵循类似原则,尽管其硬件配置的具体细节尚未完全公开。

相关模型与应用

谷歌扩展了PaLM架构,创建了几个专门的变体。Med-PaLM是在医学数据上微调的版本,在医学问答基准测试中优于之前的模型,并且是第一个在美国医学执照考试问题中获得及格分数的模型。除了准确回答多项选择题和开放式问题外,它还能提供推理并评估自己的回答。

PaLM-E是另一个使用视觉Transformer的扩展,作为一个视觉语言模型,用于机器人操作,无需重新训练或微调。2023年6月,谷歌宣布了用于语音到语音翻译的AudioPaLM,该模型使用PaLM-2架构和初始化。

可用性与影响

原始PaLM于2022年4月首次发布,并一直保持私有状态,直到2023年3月谷歌推出了一个API,最初通过候补名单向有限数量的开发者开放。PaLM 2在2023年5月Google I/O上的发布标志着谷歌致力于在快速发展的Artificial intelligence领域竞争的承诺,与OpenAIAnthropic等其他主要参与者并驾齐驱。该模型的能力对Google Cloud服务和更广泛的企业应用具有影响,使谷歌在先进Machine learning系统的发展中成为一股重要力量。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·google-ai·artificial-intelligence·deep-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史