译自英文

PaLM 2是谷歌AI开发的一款拥有3400亿参数的大型语言模型,于2023年5月发布,作为PaLM的更新版本,提升了多语言和推理能力。

PaLM 2(Pathways Language Model 2)是由Google AI开发的大型语言模型,于2023年5月在年度Google I/O主题演讲中宣布。它是原始PaLM模型的更新版本,据报道拥有3400亿参数,并在3.6万亿个token上进行训练。PaLM 2旨在擅长广泛的任务,包括常识推理、算术推理、代码生成和翻译,特别强调改进的多语言能力。

原始PaLM模型于2022年4月推出,是一个拥有5400亿参数的密集仅解码器Transformer大型语言模型。研究人员还训练了8亿和620亿参数的较小版本,以研究模型规模的影响。PaLM 2在此基础上构建,提供了增强的性能和更广泛的语言覆盖。

架构与训练

PaLM 2是一个密集的仅解码器Transformer模型,与其前身类似。它在包含7800亿个token的高质量语料库上进行预训练,该语料库包括过滤后的网页、书籍、维基百科文章、新闻文章、来自GitHub上开源仓库的源代码以及社交媒体对话。该数据集基于用于训练Google的LaMDA模型的数据集,其中社交媒体对话占语料库的50%,以增强对话能力。

原始PaLM 540B在两个TPU v4 Pod上进行训练,每个Pod有3,072个TPU v4芯片,连接到768个主机,使用模型并行和数据并行的组合。这种配置总计6,144个芯片,实现了创纪录的57.8%硬件FLOPs利用率,标志着当时该规模大型语言模型的最高训练效率。

能力与变体

PaLM 2能够执行广泛的任务,包括常识推理、算术推理、笑话解释、代码生成和翻译。当与思维链提示结合时,它在需要多步推理的数据集(如文字问题和基于逻辑的问题)上实现了显著更好的性能。

Google和DeepMind开发了Med-PaLM,这是PaLM 540B在医学数据上进行微调的版本,在医学问答基准上优于以前的模型。Med-PaLM是第一个在美国医学执照问题上获得及格分数的模型,除了提供准确答案外,还提供推理和自我评估。

Google还使用视觉Transformer扩展了PaLM,创建了PaLM-E,这是一种用于机器人操作的视觉语言模型,无需重新训练或微调。2023年6月,Google宣布了用于语音到语音翻译的AudioPaLM,它使用PaLM-2架构和初始化。

发布与访问

原始PaLM一直保持私有,直到2023年3月,Google为PaLM和若干其他技术推出了API。该API最初仅向有限数量的开发者开放,这些开发者加入了公开发布前的等待名单。PaLM 2于2023年5月宣布,预计将集成到各种Google产品和服务中。

影响与遗产

PaLM 2代表了大型语言模型的重大进步,特别是在多语言理解和推理方面。其开发与人工智能和机器学习领域的持续努力保持一致,为生成式AI的更广泛格局做出了贡献。PaLM 2被认为是LaMDA的继任者和Gemini的前身,反映了Google在该领域的持续创新。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·google-ai·natural-language-processing·transformer-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史