Traduit de l'anglais

GPT-1, introduit par OpenAI en 2018, fut le premier transformateur pré-entraîné génératif, un grand modèle de langage utilisant l'architecture du transformateur. Il a été pionnier de l'apprentissage semi-supervisé pour le traitement du langage naturel, combinant une pré-entraînement génératif sur du texte non étiqueté avec un ajustement fin discriminatif pour des tâches spécifiques.

GPT-1,全称为生成式预训练Transformer 1,是OpenAI于2018年推出的一种Large language model。它是首个将生成式预训练应用于Transformer (architecture)架构的模型,标志着现代Generative AI系统发展的基础性一步。GPT-1证明了,在一个大型未标注文本语料库上预训练的模型,可以通过微调来执行广泛的自然语言任务,且准确率很高,从而减少了对大量标注数据的需求。

背景

在2010年代,Machine learning的进步、更强大的计算机以及数字化内容的增长,推动了Artificial intelligence的繁荣。生成式预训练(GP)的概念在机器学习中早已确立,它是一种自监督学习形式。在GP中,模型首先在一个大型未标注数据集上进行训练,以学习生成数据点,然后使用较小的标注数据集针对特定任务进行适配。Transformer (architecture)架构由谷歌研究人员在2017年的论文《Attention Is All You Need》中提出,解决了旧式循环神经网络(RNN)在自然语言处理(NLP)中的许多性能问题。其注意力机制允许模型一次性处理整个序列,从而能够训练更大、更复杂的模型。

开发与发布

2018年6月11日,OpenAI研究人员发表了论文《Improving Language Understanding by Generative Pre-Training》,介绍了GPT-1。该模型基于transformer的解码器部分,并在BookCorpus(一个包含超过7000本未出版书籍的多样化语料库)上进行了预训练,以预测序列中的下一个词元。预训练之后,模型在标注数据上进行微调,以执行诸如问答、文本蕴含和情感分类等特定任务。这种半监督方法是一个突破,因为此前最先进的NLP模型严重依赖大量人工标注数据的监督学习,而获取这些数据对于大型模型来说成本过高且耗时。

GPT-1拥有1.17亿参数,在当时规模显著,并在多个基准测试中表现出色,包括GLUE(通用语言理解评估)套件,其性能超越了众多任务特定的监督模型。它的成功验证了生成式预训练方法的有效性,为后续更大规模模型(如GPT-2和GPT-3)的发展奠定了基础。

影响与遗产

GPT-1的发布为大型语言模型的快速发展奠定了基础。2019年2月14日,OpenAI推出了GPT-2,这是GPT-1的直接扩展,拥有15亿参数,并在WebText(一个包含800万个网页、共40GB文本的数据集)上进行了训练。GPT-2能够生成连贯且与上下文相关的文本,但OpenAI最初出于对恶意使用的担忧,分阶段发布了该模型。2020年5月28日,GPT-3问世,拥有1750亿参数,显著推进了少样本和零样本学习。这些模型以及后续的GPT-4,为ChatGPT等应用提供了动力,后者于2022年11月30日发布,并迅速成为全球现象。

GPT-1也影响了更广泛的人工智能生态系统。其架构和训练范式被其他组织采纳并改编,包括Google DeepMindAnthropicMeta AI。该模型的成功推动了更高效transformer架构的研究,例如稀疏注意力机制和内存高效设计,以处理更长的序列和更大的规模。

技术革新

GPT-1引入了若干关键技术革新。它使用带有掩码自注意力机制的transformer解码器来预测下一个词元,使模型能够从未标注文本中学习上下文表示。预训练目标是标准的语言建模任务,但微调阶段使用了任务特定的输入转换,使模型能够适应各种下游任务,而无需改变其架构。这种方法使GPT-1在众多NLP基准测试中取得了最先进的成果,且只需极少的任务特定工程。

另一个创新是使用像BookCorpus这样多样化的语料库,它提供了长篇连贯的文本,帮助模型学习长距离依赖关系。模型在有限标注数据上的泛化能力,与以往方法相比是一个显著进步,为未来的模型树立了先例。

更广泛的背景

GPT-1通常被认为是GPT家族中首个现代Large language model,但其影响超越了OpenAI本身。它展示了生成式预训练的潜力,而这一技术现已成为Deep learningNatural language processing中的标准方法。该模型的成功也凸显了规模的重要性,无论是在模型大小还是数据量方面,从而催生了可适应广泛任务的基础模型。如今,基于GPT的系统被用于聊天机器人、内容生成、代码辅助等众多应用,并随着多模态能力和推理增强的不断发展而持续演进。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·large-language-models·openai·natural-language-processing
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique