生成式预训练Transformer 3(GPT-3)是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列的一部分。它是一个仅解码器的Transformer深度神经网络模型,取代了基于循环和卷积的架构,采用注意力机制,能够选择性地关注相关的输入文本。GPT-3拥有1750亿个参数,每个参数采用16位精度,需要350GB的存储空间,上下文窗口为2048个标记,在许多任务上展现出强大的零样本和少样本学习能力。
背景
GPT-3的开发是机器学习领域更广泛变革的一部分,这一变革由改进的算法、更强大的计算机和日益增长的数字化数据所推动。2017年引入的Transformer架构成为自然语言处理(NLP)系统的关键基础。OpenAI研究人员于2018年6月11日发表论文,介绍了第一个生成式预训练Transformer(GPT-1),这是一种生成式大型语言模型,在大规模文本语料库上进行预训练,并针对特定任务进行微调。GPT-2于2019年2月发布,将GPT-1扩展至15亿个参数,并在800万个网页上训练。2020年2月,微软推出了拥有170亿参数的Turing自然语言生成(T-NLG),这是当时最大的语言模型。
训练与能力
2020年5月28日,由31位OpenAI工程师和研究人员撰写的arXiv预印本描述了GPT-3,这是第三代最先进的语言模型。GPT-3的容量比GPT-2增加了两个数量级以上,使其成为当时最大的非稀疏语言模型。其准确性归因于其增加的容量和参数数量,比微软的Turing NLG大十倍。Lambdalabs估计,在单个GPU上进行假设训练的成本约为460万美元,耗时355年,而使用并行GPU则实际时间更短。
预训练数据集包含60%的过滤后Common Crawl(4100亿字节对编码标记)、22%的WebText2(190亿标记)、8%的Books1(120亿标记)、8%的Books2(550亿标记)和3%的Wikipedia(30亿标记)。模糊去重使用了Apache Spark的MinHashLSH。GPT-3在数千亿个单词上训练,能够编写CSS、JSX和Python代码。
由于训练数据包罗万象,GPT-3无需针对不同任务进行进一步训练。然而,由于模仿其训练数据,它偶尔会生成有毒语言。华盛顿大学的一项研究发现,GPT-3的毒性水平与GPT-2和CTRL相当。OpenAI实施了限制有毒输出的策略,使其毒性低于GPT-1,但高于CTRL Wiki。
2020年6月11日,OpenAI宣布开放其GPT-3 API,这是一个机器学习工具集,提供文本输入、文本输出的界面,适用于任何英语任务。早期用户发现它在撰写连贯文本方面“出奇地好”。在一项实验中,80名美国受试者判断短文是人类还是GPT-3撰写的,正确识别率仅为52%,略高于随机水平。2021年11月18日,OpenAI通过内容审核工具使API访问不受限制。2022年1月27日,InstructGPT模型成为默认模型,生成的内容更符合人类意图,编造事实更少,毒性更低。
GPT-3生成与人类撰写的新闻文章难以区分的文本的能力,既具有有益应用的潜力,也具有有害应用的潜力,包括错误信息、垃圾邮件、网络钓鱼和滥用法律程序,如2020年5月28日的论文所述。
商业许可
2020年9月22日,微软宣布独家许可GPT-3。虽然其他人仍可使用公共API,但只有微软能够访问底层模型。这一独家许可是微软与OpenAI更广泛合作伙伴关系的一部分,包括投资和集成到Azure服务中。
影响与遗产
GPT-3显著影响了人工智能领域,展示了扩展Transformer模型的力量。其少样本学习能力减少了对特定任务微调的需求,启发了后续模型,如InstructGPT和后来的GPT-4。其发布也引发了关于大型语言模型伦理影响的讨论,包括偏见、错误信息和访问控制。
GPT-3的架构和训练方法成为后续大型语言模型的基准,包括来自Anthropic和Google DeepMind的模型。其通过API和微软许可的商业成功为AI研究建立了商业模式,影响了更广泛的生成式AI格局。
技术细节
GPT-3使用具有多头注意力和位置编码的Transformer架构。它采用仅解码器设计,不同于编码器-解码器模型,并使用层归一化和残差网络等技术。训练涉及使用Adam等优化器和学习率调度的梯度下降。模型参数以16位精度存储,减少了内存需求。
GPT-3的上下文窗口为2048个标记,限制了其可处理的输入长度,但它可以生成跨多个段落的连贯文本。其少样本学习通过提示实现,即在输入中提供示例,而不更新模型权重。这一能力是一个关键创新,使其无需微调即可广泛应用。
接受度与担忧
GPT-3因其令人印象深刻的文本生成而受到广泛关注,但也引发了对潜在滥用的担忧。研究人员强调了生成假新闻、垃圾邮件和网络钓鱼内容等风险。OpenAI最初的限制访问和后来的内容审核工具旨在缓解这些风险。尽管有所改进,该模型产生有毒语言的倾向仍然是一个担忧,导致了对AI安全和对齐的持续研究。
对微软的独家许可是有争议的,因为它限制了其他研究人员和公司对底层模型的访问。然而,公共API允许更广泛的实验,促进了语言模型应用的快速发展。
GPT-3的发布标志着人工智能的一个里程碑,展示了大规模Transformer模型的潜力,并塑造了机器学习和深度学习的未来。其影响体现在后续模型和不断发展的生成式AI领域中。