译自英文

OPT-175B是Meta开源的大型语言模型,拥有1750亿参数,于2022年发布,旨在使先进AI研究更加普及。它在规模上与GPT-3相当,同时提供公开的权重和代码,便于更广泛地研究LLM行为。

OPT-175B是由Meta AI开发的大型语言模型,于2022年5月发布。该模型拥有1750亿参数,旨在匹配OpenAI的GPT-3规模,同时向研究人员开放。模型的发布包括其权重、代码和训练日志,这与当时许多AI实验室的封闭做法不同。这种透明度旨在促进可复现的研究和对大规模神经网络的深入理解。

OPT-175B基于Transformer (architecture)架构构建,具体为自回归解码器-only设计。它采用与GPT-3类似的结构,具有96层、96个注意力头和12,288的隐藏维度。该模型在约1800亿个公开文本令牌的多样化语料库上训练,数据集包括书籍、网页文本和其他来源,并经过过滤以去除低质量或重复内容。训练使用了992个80GB A100 GPU,消耗约250万GPU小时,由于高效的并行技术,相比早期模型成本显著降低。

训练与优化

OPT-175B的训练过程采用了多种先进技术来管理其规模。Meta在GPU集群上结合了数据、模型和流水线并行。他们还实现了Gradient Clipping以稳定训练,并使用Learning Rate Scheduling,包括预热阶段和余弦衰减。模型使用Adam优化器训练,批量大小为400万令牌。为减少内存使用,他们采用混合精度训练,权重存储为FP16,优化器状态使用FP32。公开的训练日志记录了损失尖峰等挑战及团队的应对措施,为大规模训练动态提供了罕见见解。

开源影响

OPT-175B的发布是Large language model领域的一个里程碑。在此之前,像GPT-3这样规模的模型仅通过付费API提供,限制了学术研究。通过提供开放权重,Meta使研究人员能够直接运行、微调和探测模型。这引发了一系列关于偏见、毒性和可解释性的研究浪潮。该模型还作为后续开放模型(如BLOOM和LLaMA)的基线,这些模型借鉴了其经验。然而,开放发布也引发了滥用担忧,因为模型可能生成令人信服的虚假信息或垃圾邮件。Meta通过要求研究人员申请访问来解决这一问题,尽管权重仍比典型的专有模型更易获取。

性能与评估

在标准基准测试中,OPT-175B的表现与GPT-3相当,但略有差异。例如,在SuperGLUE套件上,它取得了相似分数,而在某些推理任务(如Winograd Schema)上,显示出微小差异。该模型在少样本学习方面表现出色,匹配GPT-3仅用少量示例适应新任务的能力。然而,它在某些事实回忆方面存在困难,有时会产生幻觉信息。Meta的评估还包括人类偏好测试,其中OPT-175B在开放式生成方面被评为与GPT-3竞争,但在某些结构化任务上落后。该模型在代码生成方面的性能不太稳健,反映了其训练数据中代码内容有限。

局限性与伦理考量

与其他大型模型一样,OPT-175B表现出训练数据中存在的偏见。Meta自己的分析发现,它可能产生刻板或冒犯性内容,特别是在性别、种族和宗教方面。该模型还有重复短语的倾向,并且容易被提示生成有害文本。为缓解这些问题,Meta提供了详细的模型卡并鼓励负责任的使用。他们还发布了较小版本OPT-1.3B,以便于实验。关于开源如此强大模型的伦理辩论仍在继续,一些人认为透明度胜过风险,而另一些人则呼吁更受控的访问。截至2024年,OPT-175B仍是开放模型开发的参考点,尽管更新模型已超越其能力。

遗产与影响

OPT-175B通过证明大规模模型可以在没有灾难性后果的情况下开放,影响了AI研究的方向。它为Meta后来的LLaMA系列铺平了道路,后者进一步提高了效率和可访问性。该模型还促进了高效训练和推理技术的发展,如激活检查点和张量并行。其公开的训练日志成为理解扩展实际挑战的宝贵资源。虽然今天不是最强大的模型,但OPT-175B在Generative AI历史上占有重要地位,代表了由专有系统主导的领域向开放性的转变。其发布鼓励了其他实验室,如AI21 LabsInflection AI,考虑开放策略,尽管许多仍选择封闭方法。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·open-source-ai·meta-ai·transformer
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史