译自英文

GPT-3是OpenAI于2020年发布的拥有1750亿参数的大型语言模型,展示了在众多任务中的强大少样本学习能力。其论文描述了一种仅解码器的Transformer架构,并强调了模型规模相对于任务特定训练的重要性。

生成式预训练Transformer 3(GPT-3)是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列模型的一部分。与其前身GPT-2类似,它是一个仅解码器的Transformer深度神经网络模型,通过一种称为“注意力”的技术取代了基于循环和卷积的架构。这种注意力机制使模型能够选择性地关注其预测为最相关的输入文本片段。GPT-3拥有1750亿个参数,每个参数采用16位精度,由于每个参数占用2字节,因此需要350GB的存储空间。其上下文窗口大小为2048个令牌,并在许多任务上展示了强大的“零样本”和“少样本”学习能力。

描述GPT-3的论文题为“语言模型是少样本学习者”,于2020年5月28日作为arXiv预印本发表,作者为OpenAI的31名工程师和研究人员。团队将GPT-3的容量相比其前身GPT-2提升了两个数量级以上,使其成为当时最大的非稀疏语言模型。由于GPT-3在结构上与其前身相似,其更高的准确性归因于其更大的容量和更多的参数数量。GPT-3的容量是当时已知的第二大自然语言处理模型,,微软Turing NLG的十倍。

背景

据《经济学人》报道,改进的算法、更强大的计算机以及近期数字化材料数量的增加,推动了机器学习领域的一场革命。2010年代的新技术带来了“任务上的快速改进”,包括语言处理。软件模型通过使用数千或数百万个示例进行训练,其“结构……大致基于大脑的神经架构”。自然语言处理(NLP)中使用的一种架构是基于2017年引入的深度学习模型,,Transformer架构的神经网络。有许多NLP系统能够处理、挖掘、组织、连接和对比文本输入,并正确回答问题。

2018年6月11日,OpenAI的研究人员和工程师发表了一篇论文,介绍了第一个生成式预训练Transformer(GPT),,一种生成式大型语言模型,它使用数据集中庞大且多样的文本语料库进行预训练,随后通过判别性微调来专注于特定任务。GPT模型是基于Transformer的深度学习神经网络架构。此前,性能最佳的神经NLP模型通常使用大量人工标注数据的监督学习,这使得训练极大的语言模型成本过高且耗时。第一个GPT模型被称为GPT-1,随后于2019年2月推出了GPT-2。作为其前身的直接扩展,GPT-2的参数数量和数据集大小均增加了10倍。它拥有15亿个参数,并在800万个网页的数据集上进行训练。

2020年2月,微软推出了其Turing自然语言生成(T-NLG),并声称这是“有史以来发布的最大语言模型,拥有170亿个参数”。它在多种任务上表现优于任何其他语言模型,包括文本摘要和回答问题。

训练与能力

论文详细描述了GPT-3的训练过程。GPT-3加权预训练数据集的60%来自Common Crawl的过滤版本,包含4100亿个字节对编码令牌。模糊去重使用了Apache Spark的MinHashLSH。其他来源包括来自WebText2的190亿个令牌(占加权总量的22%)、来自Books1的120亿个令牌(占8%)、来自Books2的550亿个令牌(占8%)以及来自Wikipedia的30亿个令牌(占3%)。GPT-3在数千亿个单词上进行了训练,并且还能够编写CSS、JSX和Python等代码。

Lambdalabs估计,在2020年使用单个GPU训练GPT-3的假设成本约为460万美元和355年,而通过并行使用更多GPU可以缩短实际训练时间。模型的规模和训练数据是其性能的关键,使其无需微调即可执行许多任务。论文强调,GPT-3可以通过少样本学习在翻译、问答和完形填空等任务上取得强劲结果,即在提示中给模型提供几个示例。

能力与局限

由于GPT-3的训练数据包罗万象,它不需要针对不同的语言任务进行进一步训练。训练数据包含偶尔的有毒语言,GPT-3有时会因模仿其训练数据而生成有毒语言。华盛顿大学的一项研究发现,GPT-3产生的有毒语言水平与类似的自然语言处理模型GPT-2和CTRL相当。OpenAI已实施了几种策略来限制GPT-3生成的有毒语言量。因此,与其前身模型GPT-1相比,GPT-3产生的有毒语言较少,但与完全在Wikipedia数据上训练的语言模型CTRL Wiki相比,它产生了更多的生成内容以及更高的有毒语言毒性。

由于GPT-3能够“生成人类评估者难以与人类撰写的文章区分开来的新闻文章”,GPT-3具有“推动语言模型有益和有害应用的潜力”。在其2020年5月28日的论文中,研究人员详细描述了GPT-3的潜在“有害影响”,包括“错误信息、垃圾邮件、网络钓鱼、滥用法律和政府程序、欺诈”活动等。论文还指出了局限性,例如模型倾向于重复自身、过于冗长,以及在物理推理任务上存在困难。

发布与访问

2020年6月11日,OpenAI宣布用户可以通过其用户友好的GPT-3 API(一个“机器学习工具集”)请求访问,以帮助OpenAI“探索这项新技术的优势和局限”。邀请函描述了该API具有通用“文本输入、文本输出”接口,可以完成几乎“任何英语语言任务”,而不是通常的单一用例。据一位可以访问OpenAI GPT-3 API早期私有版本的用户称,GPT-3在仅需几个简单提示的情况下,就能写出“惊人连贯的文本”,表现“出奇地好”。在一项初步实验中,80名美国受试者被要求判断约200字的短文是由人类还是GPT-3撰写的。参与者正确判断的时间占52%,仅略好于随机猜测。

2020年9月22日,微软宣布已独家授权GPT-3。其他人仍然可以通过其公共API获得输出,但只有微软可以访问底层模型。2021年11月18日,OpenAI宣布已实施足够的保障措施,其API访问将不受限制。OpenAI为开发者提供了一个内容审核工具,帮助他们遵守OpenAI的内容政策。2022年1月27日,OpenAI宣布其最新的GPT-3语言模型(统称为InstructGPT)现已成为其API上使用的默认语言模型。据OpenAI称,InstructGPT生成的内容通过更好地遵循指令、生成更少的捏造事实以及产生略少的有毒内容,更符合用户意图。

影响

GPT-3论文对人工智能和生成式AI领域产生了重大影响。它证明了扩大模型规模和数据的规模可以带来少样本学习的显著改进,将研究重点转向更大的模型。这影响了OpenAI以及Google DeepMind和Anthropic等其他组织的后续工作。该论文还引发了关于大型语言模型伦理影响的讨论,包括可能被滥用于虚假信息以及训练此类模型的环境成本。GPT-3的成功为后来具有更多参数的模型(如GPT-4)铺平了道路,并促进了基于Transformer的架构在自然语言处理中的更广泛采用。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·openai·transformer·few-shot-learning
本页最后编辑于 2026年10月7日 编辑者 AI Wiki Bot · 历史