GPT-3(2020年)

译自英文

GPT-3是OpenAI于2020年发布的大型语言模型,拥有1750亿参数,以其强大的少样本学习和广泛的文本生成能力而闻名。

生成式预训练Transformer 3(GPT-3)是OpenAI于2020年发布的大型语言模型,属于该公司GPT系列的一部分。它是一个仅解码器的Transformer (architecture)模型,采用Deep learning神经网络架构,通过注意力机制取代了基于循环和卷积的设计,使模型能够选择性地关注输入文本的相关片段。GPT-3拥有1750亿个参数,每个参数以16位精度存储,需要350GB的存储空间,上下文窗口为2048个标记。它在许多任务中展示了强大的零样本和少样本学习能力。

2020年9月22日,微软宣布已独家授权GPT-3。其他人仍可通过其公共API获取输出,但只有微软能够访问底层模型。

背景

2010年代,算法改进、更强大的计算机以及数字化材料的增加推动了Machine learning领域的革命,导致包括语言处理在内的任务快速进步。软件模型使用数千或数百万个示例进行训练,这些示例的结构大致基于大脑的神经架构。自然语言处理中使用的一种架构是基于transformer架构的神经网络,该架构于2017年引入。这使系统能够处理、挖掘、组织、连接和对比文本输入,并回答问题。

2018年6月11日,OpenAI研究人员发表了一篇论文,介绍了第一个生成式预训练Transformer(GPT),这是一种生成式大型语言模型,在庞大且多样的文本语料库上进行预训练,随后针对特定任务进行判别式微调。此前,性能最佳的神经NLP模型通常使用大量手动标注数据的监督学习,这既昂贵又耗时。第一个GPT模型之后是2019年2月的GPT-2,这是一个直接扩展的模型,拥有15亿个参数,在800万个网页上训练。2020年2月,微软推出了Turing自然语言生成(T-NLG),声称是当时最大的语言模型,拥有170亿个参数。

训练与能力

2020年5月28日,OpenAI的31名工程师和研究人员发表了一篇arXiv预印本,描述了GPT-3,这是一个第三代最先进的语言模型。团队将容量比GPT-2增加了两个数量级以上,使GPT-3成为当时最大的非稀疏语言模型。其更高的准确性归因于增加的容量和参数,比微软的Turing NLG大十倍。Lambdalabs估计,在2020年使用单个GPU训练GPT-3的假设成本约为460万美元和355年,而使用并行GPU的实际训练时间更短。

加权预训练数据集的60%来自Common Crawl的过滤版本,包含4100亿个字节对编码标记。模糊去重使用了Apache Spark的MinHashLSH。其他来源包括WebText2的190亿个标记(占加权总量的22%)、Books1的120亿个标记(8%)、Books2的550亿个标记(8%)以及维基百科的30亿个标记(3%)。GPT-3在数千亿个单词上训练,并且还能编写CSS、JSX和Python代码。

由于训练数据包罗万象,GPT-3不需要针对不同语言任务进行额外训练。训练数据中偶尔包含有毒语言,GPT-3有时通过模仿这些语言生成有毒内容。华盛顿大学的一项研究发现,GPT-3产生的有毒语言水平与GPT-2和CTRL相当。OpenAI实施了限制有毒输出的策略,导致其有毒语言少于GPT-1,但生成次数和毒性高于完全在维基百科数据上训练的CTRL Wiki模型。

公共访问与演进

2020年6月11日,OpenAI宣布用户可以请求访问其GPT-3 API,这是一个机器学习工具集,用于探索该技术的优势和局限。该API具有通用的文本输入、文本输出接口,可以完成几乎任何英语语言任务。一位早期用户将GPT-3描述为“出奇地擅长”通过简单提示生成连贯文本。在初步实验中,80名美国受试者判断短文是人类撰写还是GPT-3生成,正确识别率仅为52%,略高于随机猜测。

2021年11月18日,OpenAI宣布已实施足够的保障措施,使API访问不受限制,为开发者提供了内容审核工具。2022年1月27日,OpenAI宣布其最新的GPT-3模型(统称为InstructGPT)成为API的默认模型,生成的内容更符合用户意图,更好地遵循指令,生成更少的虚构事实,并产生略少的有毒内容。

影响与担忧

由于GPT-3能够生成人类评估者难以与人类撰写文章区分的新闻文章,它有可能推动语言模型的有利和有害应用。在2020年5月28日的论文中,研究人员描述了潜在的有害影响,包括错误信息、垃圾邮件、网络钓鱼、滥用法律和政府程序以及欺诈活动。该模型的广泛能力引发了关于Generative AI社会影响以及负责任部署必要性的讨论。

遗产

GPT-3标志着Artificial intelligence发展中的一个重要里程碑,证明了扩展transformer模型可以显著改善语言理解和生成。其架构和训练方法影响了后续模型,包括OpenAI内部的继任者以及AnthropicGoogle DeepMind等其他组织的努力。对微软的独家授权凸显了大型语言模型的商业价值,并塑造了云计算服务的竞争格局,Microsoft Azure将GPT-3集成到其产品中。GPT-3还促进了关于大型模型对齐、安全性和评估的研究,为更广泛的Neural network研究领域做出了贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·openai·generative-ai·machine-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史