生成式预训练Transformer 3(GPT-3)是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列的一部分。它是一个仅解码器的Transformer (architecture)模型,基于Deep learning技术,通过注意力机制取代了基于循环和卷积的架构,使模型能够选择性地关注相关的输入文本。GPT-3拥有1750亿个参数,每个参数采用16位精度,需要350GB的存储空间。其上下文窗口为2,048个标记,并在许多任务上展示了强大的零样本和少样本学习能力。
背景
根据《经济学人》的报道,改进的算法、更强大的计算机以及日益增长的数字化材料推动了Machine learning领域的革命。2010年代的新技术带来了语言处理任务的快速进步。软件模型通过数千或数百万个示例进行训练,其结构大致基于大脑的神经架构。一个关键的架构是2017年引入的transformer,它成为Natural language processing系统的核心。
2018年6月11日,OpenAI研究人员发表了一篇论文,介绍了第一个生成式预训练transformer(GPT),这是一种在多样化文本语料库上预训练的生成式大型语言模型,随后进行判别性微调。GPT-1之后是2019年2月的GPT-2,其参数和数据集规模扩大了10倍,达到15亿个参数,并在800万个网页上进行训练。2020年2月,微软推出了具有170亿参数的Turing自然语言生成(T-NLG),当时是已发布的最大语言模型。
训练与能力
2020年5月28日,由31位OpenAI工程师和研究人员撰写的arXiv预印本描述了GPT-3,这是一个第三代最先进的语言模型。团队将容量从GPT-2提升了两个数量级以上,使GPT-3成为当时最大的非稀疏语言模型。其准确性归因于增加的容量和参数,比微软的Turing NLG大十倍。Lambdalabs估计,在2020年使用单个GPU训练的理论成本约为460万美元和355年,而使用并行GPU的实际时间则更低。
加权预训练数据集的60%来自Common Crawl的过滤版本,包含4100亿个字节对编码标记,并使用Apache Spark的MinHashLSH进行模糊去重。其他来源包括WebText2(190亿个标记,22%)、Books1(120亿个标记,8%)、Books2(550亿个标记,8%)和Wikipedia(30亿个标记,3%)。GPT-3在数千亿个单词上进行了训练,并能编写CSS、JSX和Python代码。
由于训练数据包罗万象,GPT-3不需要针对不同任务进行额外训练。然而,它偶尔会生成模仿其训练数据的有毒语言。华盛顿大学的一项研究发现,GPT-3产生的有毒语言与GPT-2和CTRL相当。OpenAI实施了限制毒性的策略,导致其输出比GPT-1更少毒性,但比CTRL Wiki更多。
API与访问
2020年6月11日,OpenAI宣布用户可以请求访问其GPT-3 API,这是一个具有通用文本输入、文本输出接口的机器学习工具集。一位早期用户将其描述为在简单提示下生成连贯文本方面出奇地好。在一项实验中,80名美国受试者判断短文是人类还是GPT-3撰写的,正确率仅为52%,略高于随机水平。
2020年9月22日,微软宣布独家授权GPT-3。其他人仍可从公共API获取输出,但只有微软能访问底层模型。2021年11月18日,OpenAI宣布提供无限制的API访问,并附带内容审核工具。2022年1月27日,OpenAI将InstructGPT设为默认模型,该模型能更好地遵循指令并生成更少的虚构事实。
影响与担忧
GPT-3可以生成人类评估者难以与人类撰写的文章区分开来的新闻文章,具有有益和有害应用的潜力。2020年5月的论文详细描述了潜在危害,包括错误信息、垃圾邮件、网络钓鱼以及滥用法律和政府流程。该模型的发布推动了Generative AI的进一步发展,并影响了Anthropic和Google DeepMind的后续模型。其架构和训练方法成为后来大型语言模型的基础,其API模型也影响了Microsoft Azure和Amazon Web Services上的商业AI服务。
遗产
GPT-3标志着公众对大型语言模型认知的转折点,展示了扩展transformer模型规模可以产生涌现能力。其1750亿参数的规模树立了基准,尽管后来的模型超过了它。对微软的独家授权凸显了此类模型的商业价值。GPT-3的少样本学习能力减少了对任务特定微调的需求,影响了Reinforcement Learning from AI Feedback (RLAIF)和指令遵循方面的研究。其发布也引发了关于AI安全、偏见以及训练大型模型环境成本的讨论。