PaLM(路径语言模型)

译自英文

PaLM(路径语言模型)是由Google AI开发的5400亿参数、基于Transformer的大型语言模型,于2022年4月发布。它在推理、代码生成和翻译方面表现出色,并于2023年被PaLM 2所取代。

PaLM(Pathways语言模型)是由Google AI开发的大型语言模型,于2022年4月首次公布。它是一个基于Transformer的密集解码器专用模型,拥有5400亿个参数,使其成为发布时规模最大的语言模型之一。该模型使用谷歌的Pathways系统进行训练,该系统支持在多个TPU Pod间实现高效训练。研究人员还训练了80亿和620亿参数的较小版本,以研究模型规模对性能的影响。

PaLM在广泛任务中展现出强大能力,包括常识推理、算术推理、笑话解释、代码生成和翻译。当与思维链提示相结合时,PaLM在需要多步推理的数据集(如文字题和逻辑类问题)上取得了显著更好的表现。该模型一直保持私有状态,直到2023年3月谷歌为其推出了API,最初通过候补名单向有限数量的开发者开放,随后才公开推出。

架构与训练

PaLM基于Transformer (architecture)架构,具体采用解码器专用设计。540B版本是在一个包含7800亿个标记的语料库上进行预训练的,该语料库由经过筛选的网页、书籍、维基百科文章、新闻文章、GitHub仓库中的源代码以及社交媒体对话组成。该数据集源自用于训练谷歌LaMDA模型的数据集,其中社交媒体对话占语料库的50%,以增强对话能力。

训练540B模型需要两个TPU v4吊舱,每个吊舱有3072个TPU v4芯片连接至768台主机,采用模型并行和数据并行的组合方式进行连接。这一配置共计6144个芯片,是当时最大的TPU设置,并实现了57.8%的硬件FLOPs利用率,这是该规模下的训练效率纪录。训练过程利用了Pathways系统,该系统支持跨多个吊舱的高效扩展。

变体与应用

谷歌和DeepMind开发了Med-PaLM,这是PaLM 540B在医学数据上微调后得到的版本。Med-PaLM在医学问答基准测试中超越了以往模型,并且是首个在美国医学执照考试中获得合格分数的模型。它能够为其答案提供推理过程,并能评估自身响应。

谷歌还将PaLM与视觉Transformer结合以创建PaLM-E,这是一种面向机器人操作的视觉语言模型,无需重新训练或微调即可适应新任务。2023年6月,谷歌宣布推出用于语音到语音翻译的AudioPaLM,该模型采用了PaLM-2架构和初始化。

后续者:PaLM 2

2023年5月,谷歌在年度Google I/O主题会议上公布了PaLM 2。据报道,PaLM 2是一个3400亿参数的模型,在3.6万亿个标记上进行训练,作为PaLM的后续者,为多种谷歌产品和服务提供支撑。PaLM 2在多语言能力、推理和编码等方面相比前代有所改进,并通过PaLM API和其他谷歌云服务提供。

影响与遗产

PaLM代表着大型语言模型发展中的一个重要步骤,展示了在基于大规模分布式系统上以空前规模训练模型的可行性。其成功对后续模型产生了影响,包括Gemini(Gemini),后者接替了PaLM成为谷歌的旗舰语言模型。PaLM在思维链提示和PaLM-E等多模态扩展方面的贡献也推动了推理和具身AI研究的发展。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·google-ai·transformer·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史