OPT(Open Pre-trained Transformer)是一系列仅解码器的大型语言模型,由Meta AI开发并于2022年5月发布。该系列模型的参数规模从1.25亿到1750亿不等,其中最大的模型OPT-175B与GPT-3的规模相当。与许多同期模型不同,OPT公开了其权重、训练代码和详细日志,旨在促进大规模语言模型研究的民主化。
OPT的架构遵循标准的Transformer解码器设计,并融入了层归一化和残差连接等改进。这些模型在一个包含1800亿个令牌的多样化语料库上训练,语料来源包括Common Crawl、维基百科和BooksCorpus。训练过程强调计算效率和稳定性,采用了动态损失缩放和梯度裁剪等技术。
开发与发布
OPT在论文《OPT: Open Pre-trained Transformer Language Models》中由Susan Zhang及其在Meta AI的同事提出。该发布不仅包括模型权重,还公开了训练代码和详细的训练日志,这在当时同类规模的模型中尚属首次。其目标是鼓励研究社区内的可复现性和协作。
这些模型在非商业许可下发布,访问需通过申请流程。发布同时提供了演示和文档。最大的模型OPT-175B需要大量计算资源,但为了适应不同的研究需求,也提供了较小的变体(如1.25亿、3.5亿、13亿、27亿、67亿、130亿和300亿参数版本)。
架构与训练
OPT采用仅解码器的架构,使用因果注意力机制,与GPT-3类似。关键设计选择包括预归一化(在每个子层之前应用层归一化)、使用ReLU激活函数而非GELU,以及学习到的位置嵌入。训练数据经过过滤和去重,模型使用Adam优化器和余弦学习率调度进行训练。
OPT-175B的训练在NVIDIA A100 GPU上耗时约992个GPU小时,由于优化技术,其效率显著高于同类模型。训练过程中记录了损失峰值等问题,并采用了相应的缓解策略。
性能与评估
OPT模型在多个自然语言处理基准测试上进行了评估,包括SuperGLUE、SQuAD和OpenBookQA。虽然OPT-175B在多项任务上与GPT-3表现相当,但在代码生成任务上略逊一筹。这些模型在少样本学习场景中表现出色,性能随示例数量的增加而提升。
在零样本和少样本设置下,OPT-175B在问答和常识推理任务上取得了强劲的结果。然而,与其他大型模型一样,它也可能产生有偏见或有害的输出,论文对此进行了局限性和伦理方面的讨论。
影响与遗产
OPT是开源AI社区的一个重要里程碑,为大规模模型开发的透明度树立了先例。它影响了后续的开源模型,如BLOOM和LLaMA。OPT的可用性使研究人员能够在没有专有模型壁垒的情况下研究模型行为、微调和可解释性。
该发布也引发了关于开源强大模型风险的讨论,包括潜在的滥用问题。Meta AI实施了负责任的发布策略,包括用例政策和访问控制。尽管存在这些担忧,OPT仍然是学术研究中广泛使用的基线模型,也是开源模型开发的重要参考点。
参见
参考文献
- Zhang, S., et al. (2022). "OPT: Open Pre-trained Transformer Language Models." arXiv:2205.01068.
- Meta AI. (2022). "Introducing OPT."