PaLM(Pathways语言模型)是由Google AI开发的大型语言模型,于2022年4月首次公布。它是一个基于Transformer的密集解码器专用模型,拥有5400亿个参数,使其成为发布时规模最大的语言模型之一。该模型使用谷歌的Pathways系统进行训练,该系统支持在多个TPU Pod间实现高效训练。研究人员还训练了80亿和620亿参数的较小版本,以研究模型规模对性能的影响。
PaLM在广泛任务中展现出强大能力,包括常识推理、算术推理、笑话解释、代码生成和翻译。当与思维链提示相结合时,PaLM在需要多步推理的数据集(如文字题和逻辑类问题)上取得了显著更好的表现。该模型一直保持私有状态,直到2023年3月谷歌为其推出了API,最初通过候补名单向有限数量的开发者开放,随后才公开推出。
架构与训练
PaLM基于Transformer (architecture)架构,具体采用解码器专用设计。540B版本是在一个包含7800亿个标记的语料库上进行预训练的,该语料库由经过筛选的网页、书籍、维基百科文章、新闻文章、GitHub仓库中的源代码以及社交媒体对话组成。该数据集源自用于训练谷歌LaMDA模型的数据集,其中社交媒体对话占语料库的50%,以增强对话能力。
训练540B模型需要两个TPU v4吊舱,每个吊舱有3072个TPU v4芯片连接至768台主机,采用模型并行和数据并行的组合方式进行连接。这一配置共计6144个芯片,是当时最大的TPU设置,并实现了57.8%的硬件FLOPs利用率,这是该规模下的训练效率纪录。训练过程利用了Pathways系统,该系统支持跨多个吊舱的高效扩展。
变体与应用
谷歌和DeepMind开发了Med-PaLM,这是PaLM 540B在医学数据上微调后得到的版本。Med-PaLM在医学问答基准测试中超越了以往模型,并且是首个在美国医学执照考试中获得合格分数的模型。它能够为其答案提供推理过程,并能评估自身响应。
谷歌还将PaLM与视觉Transformer结合以创建PaLM-E,这是一种面向机器人操作的视觉语言模型,无需重新训练或微调即可适应新任务。2023年6月,谷歌宣布推出用于语音到语音翻译的AudioPaLM,该模型采用了PaLM-2架构和初始化。
后续者:PaLM 2
2023年5月,谷歌在年度Google I/O主题会议上公布了PaLM 2。据报道,PaLM 2是一个3400亿参数的模型,在3.6万亿个标记上进行训练,作为PaLM的后续者,为多种谷歌产品和服务提供支撑。PaLM 2在多语言能力、推理和编码等方面相比前代有所改进,并通过PaLM API和其他谷歌云服务提供。
影响与遗产
PaLM代表着大型语言模型发展中的一个重要步骤,展示了在基于大规模分布式系统上以空前规模训练模型的可行性。其成功对后续模型产生了影响,包括Gemini(Gemini),后者接替了PaLM成为谷歌的旗舰语言模型。PaLM在思维链提示和PaLM-E等多模态扩展方面的贡献也推动了推理和具身AI研究的发展。
另见
- LaMDA - PaLM的前代
- Gemini - PaLM的后续者
- Chinchilla - 相关语言模型