GPT-3,全称生成式预训练变换器3,是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列的一部分。它是一个仅解码器的变换器模型,利用注意力机制聚焦输入文本的相关部分,取代了基于循环和卷积的架构。GPT-3拥有1750亿个参数,在其发布时是最大的非稀疏语言模型,由于每个参数采用16位精度,需要350GB的存储空间。它的上下文窗口为2,048个标记,并在许多任务中展示了强大的零样本和少样本学习能力。
GPT-3的发布标志着生成式人工智能的一个里程碑,展示了扩展基于变换器的神经网络的潜力。其能力影响了后续大型语言模型的发展,并引发了关于此类系统利弊的讨论。
背景
GPT-3的开发根植于2010年代机器学习的进步,得益于改进的算法、更强大的计算机和增加的数字化数据。2017年引入的变换器架构成为自然语言处理的关键基础。OpenAI的首个生成式预训练变换器(GPT-1)于2018年6月推出,随后是2019年2月的GPT-2,其参数和数据集规模扩大了10倍,达到15亿个参数。2020年2月,微软推出了拥有170亿个参数的图灵自然语言生成模型(T-NLG),当时是最大的语言模型。
训练与能力
2020年5月28日,由31位OpenAI研究人员撰写的arXiv预印本描述了GPT-3,其容量相比GPT-2增加了两个数量级以上。训练数据集包括60%的过滤Common Crawl(4100亿个标记)、22%的WebText2、8%的Books1、8%的Books2和3%的维基百科。GPT-3在数千亿个单词上进行了训练,并能编写CSS、JSX和Python等语言的代码。Lambda Labs估计训练成本约为460万美元,在单个GPU上需要355年,但并行化减少了实际时间。
GPT-3的全方位训练数据意味着它不需要针对不同任务进行微调,但由于数据中的偏见,它可能生成有毒语言。华盛顿大学的一项研究发现,其毒性水平与GPT-2和CTRL相当。OpenAI实施了安全措施,到2021年11月,API访问变得不受限制。2022年1月,InstructGPT模型成为默认模型,更好地符合用户意图并产生较少有毒内容。
影响与反响
GPT-3生成连贯文本的能力,使人类难以轻易区分其与人类撰写的内容,这既带来了机遇也引发了担忧。在一项实验中,80名美国受试者正确判断短文章的比例仅为52%,接近随机水平。原始论文中指出了该模型在虚假信息、垃圾邮件和网络钓鱼方面的潜在风险。GPT-3还影响了更广泛的人工智能领域,推动了对大型语言模型和生成式人工智能的进一步研究。
商业化与许可
2020年9月22日,微软宣布获得GPT-3的独家许可,允许访问底层模型,而其他人仍可使用公共API。这笔交易凸显了先进AI模型的商业价值,并为行业未来的合作伙伴关系树立了先例。该许可安排是微软对OpenAI更广泛投资的一部分,并将其集成到Azure等产品中。
遗产
GPT-3的发布加速了自然语言处理的进展,并启发了来自各组织的后续模型,包括Anthropic和Google DeepMind。其架构和训练方法成为后续发展(如InstructGPT及其他继任者)的基准。该模型还引发了关于AI伦理、安全性和内容审核需求的讨论,塑造了机器学习研究和部署的轨迹。