OPT(开放预训练Transformer)是一个仅解码器的大型语言模型家族,由Meta AI开发,并于2022年5月发布。该系列涵盖从1.25亿到1750亿的参数规模,其中最大的模型OPT-175B与GPT-3的规模相当。与许多同期模型不同,OPT公开提供了其权重、训练代码和详细日志,旨在推动大规模语言模型研究的民主化。
OPT的架构遵循标准的Transformer (architecture)解码器设计,并融入了层归一化和残差连接等改进。这些模型在包含1800亿个token的多样化语料库上训练,语料来源包括Common Crawl、维基百科和BooksCorpus。训练过程强调计算效率和稳定性,采用了动态损失缩放和梯度裁剪等技术。
开发与发布
OPT在一篇题为“OPT: Open Pre-trained Transformer Language Models”的论文中由Susan Zhang及其在Meta AI的同事提出。此次发布不仅包括模型权重,还提供了训练代码和详细的训练过程日志,这在如此规模的模型中前所未有。其目标是促进人工智能研究社区内的可复现性和协作。
这些模型在非商业许可下提供,并通过申请流程授予访问权限。发布同时附带了演示和文档。最大的模型OPT-175B需要大量计算资源,但也提供了较小的变体(如125M、350M、1.3B、2.7B、6.7B、13B、30B、66B),以满足不同的研究需求。
架构与训练
OPT采用仅解码器架构,具有因果注意力机制,类似于GPT-3。关键设计选择包括预归一化(在每个子层之前应用层归一化)、使用ReLU激活函数而非GELU,以及学习的位置嵌入。训练数据经过过滤和去重,模型使用Adam优化器和余弦学习率调度进行训练。
OPT-175B的训练在NVIDIA A100 GPU上耗时约992个GPU小时,由于优化技术,其效率显著高于同类模型。训练日志记录了诸如损失尖峰等挑战及相应的缓解策略。
性能与评估
OPT模型在多种自然语言处理基准上进行了评估,包括SuperGLUE、SQuAD和OpenBookQA。虽然OPT-175B在许多任务上与GPT-3表现相当,但也显示出一些差异,例如在代码生成任务上性能略低。这些模型还展现了少样本学习能力,随着提供的示例数量增加而表现提升。
在零样本和少样本设置中,OPT-175B在问答和常识推理任务上取得了强劲结果。然而,与其他大型模型一样,它可能产生有偏见或有害的输出,论文中讨论了相关局限性和伦理考量。
影响与遗产
OPT是开源AI社区中的一个里程碑式发布,为大规模模型开发的透明度树立了先例。它影响了后续的开放模型,如BLOOM和LLaMA。OPT的可用性使研究人员能够研究模型行为、微调和可解释性,而无需受限于专有模型的障碍。
此次发布也引发了关于开源强大模型风险的讨论,包括潜在的滥用。Meta AI实施了负责任的发布策略,包括用例政策和访问控制。尽管存在这些担忧,OPT仍然是学术研究中广泛使用的基线,也是开放模型开发的参考点。
参见
参考文献
- Zhang, S., et al. (2022). “OPT: Open Pre-trained Transformer Language Models.” arXiv:2205.01068.
- Meta AI. (2022). “Introducing OPT.”