PaLM 2 是谷歌开发的大型语言模型(LLM),于2023年5月在年度Google I/O主题演讲中发布。它是Pathways语言模型(PaLM)的继任者,后者是谷歌AI开发的一个拥有5400亿参数的密集解码器专用、基于Transformer的LLM。据报道,PaLM 2是一个拥有3400亿参数的模型,在3.6万亿个令牌上训练,代表了在其前身基础上规模和能力的显著进步。
该模型是谷歌在Generative AI和Large language model研究领域更广泛努力的一部分,建立在支撑现代Deep learning系统的Transformer架构之上。PaLM 2是与Google DeepMind共同开发的,反映了谷歌AI研究部门的整合。
架构与能力
PaLM 2遵循其前身确立的解码器专用Transformer设计,利用Multi-Head Attention机制和Positional Encoding来处理序列数据。该模型能够执行广泛的任务,包括常识推理、算术推理、笑话解释、代码生成和翻译。当与思维链提示结合时,PaLM 2在需要多步推理的数据集(如文字题和基于逻辑的问题)上取得了显著更好的性能。
该模型在3.6万亿个令牌上的训练(较原始PaLM使用的7800亿个令牌大幅增加)使其在多个领域表现出增强的性能。这个训练语料库包括过滤后的网页、书籍、维基百科文章、新闻文章、来自开源代码仓库的源代码以及社交媒体对话,其中社交媒体部分占语料库的50%,以支持对话能力。
训练基础设施
原始PaLM 540B在两个TPU v4 Pod上训练,每个Pod有3,072个TPU v4芯片,连接到768台主机,使用模型并行和数据并行的组合进行连接。这种配置总共使用6,144个芯片,创下了该规模LLM最高训练效率的纪录,硬件FLOPs利用率达到57.8%。PaLM 2的训练基础设施遵循类似原则,尽管其硬件配置的具体细节尚未完全公开。
相关模型与应用
谷歌扩展了PaLM架构,创建了几个专门的变体。Med-PaLM是在医学数据上微调的版本,在医学问答基准测试中优于之前的模型,并且是第一个在美国医学执照考试问题中获得及格分数的模型。除了准确回答多项选择题和开放式问题外,它还能提供推理并评估自己的回答。
PaLM-E是另一个使用视觉Transformer的扩展,作为一个视觉语言模型,用于机器人操作,无需重新训练或微调。2023年6月,谷歌宣布了用于语音到语音翻译的AudioPaLM,该模型使用PaLM-2架构和初始化。
可用性与影响
原始PaLM于2022年4月首次发布,并一直保持私有状态,直到2023年3月谷歌推出了一个API,最初通过候补名单向有限数量的开发者开放。PaLM 2在2023年5月Google I/O上的发布标志着谷歌致力于在快速发展的Artificial intelligence领域竞争的承诺,与OpenAI和Anthropic等其他主要参与者并驾齐驱。该模型的能力对Google Cloud服务和更广泛的企业应用具有影响,使谷歌在先进Machine learning系统的发展中成为一股重要力量。