OpenAI GPT-3 发布

译自英文

GPT-3是OpenAI于2020年6月发布的大型语言模型,拥有1750亿个参数,以其零样本和少样本能力著称。其API的发布实现了广泛访问,微软随后独家授权了该模型。

生成式预训练Transformer 3(GPT-3)是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列模型的一部分。它是一个仅解码器的Transformer (architecture)模型,属于深度神经网络,利用注意力机制选择性聚焦于相关输入片段。GPT-3拥有1750亿个参数,每个参数以16位精度存储,需要350GB存储空间,并支持2048个令牌的上下文窗口。它在许多任务中展示了强大的零样本和少样本学习能力,其通过API发布的消息于2020年6月11日公布。

背景

据《经济学人》报道,改进的算法、更强大的计算机以及不断增长的数字化语料库推动了Machine learning领域的革命。2010年代的新技术带来了语言处理能力的快速提升,这些技术依赖于大致基于大脑的神经架构。2017年引入的Transformer (architecture)架构成为Natural language processing系统的基础。2018年6月,OpenAI发布了首个生成式预训练Transformer(GPT-1),该模型在大规模文本语料库上训练,然后针对特定任务进行微调。GPT-2于2019年2月紧随其后,将参数和数据集规模扩大了十倍,达到15亿个参数,并在800万个网页上训练。2020年2月,微软推出了Turing NLG,这是一个拥有170亿参数的模型,当时被认为是最大的模型。

训练与能力

2020年5月28日,由31位OpenAI工程师和研究人员撰写的arXiv预印本描述了GPT-3的开发过程,其模型容量比GPT-2增加了两个数量级以上,使其成为当时最大的非稀疏语言模型。其准确性源于增加的容量和参数,比微软的Turing NLG大十倍。Lambdalabs估计,在2020年,训练成本为460万美元,相当于在单个GPU上运行355年。预训练数据包括4100亿个字节对编码令牌,来自过滤后的Common Crawl(占加权数据的60%),以及WebText2、Books1、Books2和维基百科(占3%)。GPT-3还能用Python、JSX和CSS编写代码。

GPT-3缺乏任务特定的微调,而是处理广泛的指令。然而,训练数据中包含有毒语言,模型有时会重现这些内容。华盛顿大学的一项研究发现,GPT-3的有毒性水平与GPT-2和CTRL相当。OpenAI实施了缓解策略,与GPT-1相比减少了有毒输出。

API访问与评估

2020年6月11日,OpenAI发布了一个通用API,采用文本输入文本输出的界面,能够处理任何英语任务,而非单一用途案例。早期测试者形容GPT-3在生成连贯文本方面出奇地出色。在一项涉及80名美国参与者的实验中,区分GPT-3文章与人类撰写文章的正确率仅为52%,略高于随机猜测。到2021年11月18日,OpenAI通过内容审核工具扩大了其API的访问范围。2022年1月27日,InstructGPT成为默认API模型,改进了指令遵循能力并减少了虚构事实。

许可与影响

2020年9月22日,微软宣布获得GPT-3底层模型的独家许可。其他人可以使用公共API,但只有微软能够访问代码和权重。GPT-3展示了生成难以与人类写作区分的新闻文章的潜力,引发了对错误信息和欺诈的担忧。研究人员描述了潜在的有害影响,包括垃圾邮件和法律滥用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·large-language-model·generative-ai·natural-language-processing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史