英語からの翻訳

OPT(Open Pre-trained Transformer)は、Meta AIによって開発され、2022年5月に公開されたデコーダーのみの言語モデルのスイートである。モデルは1億2500万から1750億パラメータの範囲に及び、重み、コード、トレーニングログを含む完全なオープンソース化が特徴である。

OPT(Open Pre-trained Transformer)是一个仅使用解码器的大型语言模型家族,由Meta AI开发并于2022年5月发布。该系列模型的参数规模从1.25亿到1750亿不等,其中最大的模型OPT-175B与GPT-3的规模相当。与许多同期模型不同,OPT公开了其权重、训练代码和详细日志,旨在推动大规模语言模型研究的民主化。

OPT的架构遵循标准的Transformer解码器设计,并融入了层归一化和残差连接等改进。这些模型在一个包含1800亿个token的多样化语料库上训练,语料来源包括Common CrawlWikipedia和BooksCorpus。训练过程强调计算效率和稳定性,采用了动态损失缩放和梯度裁剪等技术。

开发与发布

OPT在论文《OPT: Open Pre-trained Transformer Language Models》中由Susan Zhang及其在Meta AI的同事提出。该发布不仅包括模型权重,还提供了训练代码和详细的训练过程日志,这在当时对于如此规模的模型而言是前所未有的。其目标是促进可复现性和协作,推动人工智能研究社区的发展。

这些模型在非商业许可下发布,并通过申请流程提供访问权限。发布同时附带演示和文档。最大的模型OPT-175B需要大量计算资源,但同时也提供了较小的变体(如125M、350M、1.3B、2.7B、6.7B、13B、30B和66B),以满足不同的研究需求。

架构与训练

OPT采用仅解码器的架构,使用因果注意力机制,与GPT-3类似。关键设计选择包括预归一化(在每个子层之前应用层归一化)、使用ReLU激活函数而非GELU,以及学习位置嵌入。训练数据经过过滤和去重处理,模型使用Adam优化器和余弦学习率调度进行训练。

OPT-175B的训练大约使用了992个GPU小时(在NVIDIA A100上),由于优化技术,其效率显著高于同类模型。训练日志记录了诸如损失尖峰等挑战及其缓解策略。

性能与评估

OPT模型在多个自然语言处理基准测试中进行了评估,包括SuperGLUESQuADOpenBookQA。虽然OPT-175B在许多任务上与GPT-3表现相当,但在代码生成任务上表现略逊一筹。这些模型还展示了少样本学习能力,随着提供的示例数量增加,性能有所提升。

在零样本和少样本设置下,OPT-175B在问答和常识推理任务上取得了强劲的结果。然而,与其他大型模型一样,它也可能产生有偏见或有害的输出,论文中讨论了这些局限性和伦理考量。

影响与遗产

OPT是开源AI社区的一个里程碑式发布,为大规模模型开发的透明度树立了先例。它影响了后续的开源模型,如BLOOMLLaMA。OPT的可用性使研究人员能够研究模型行为、微调可解释性,而无需依赖专有模型的限制。

该发布也引发了关于开源强大模型风险的讨论,包括潜在的滥用问题。Meta AI实施了负责任的发布策略,包括用例政策和访问控制。尽管存在这些担忧,OPT仍然是学术研究中广泛使用的基线,也是开源模型开发的参考点。

参见

参考文献

  • Zhang, S., et al. (2022). "OPT: Open Pre-trained Transformer Language Models." arXiv:2205.01068.
  • Meta AI. (2022). "Introducing OPT."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·meta-ai·open-source-ai·transformer-architecture
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴