GPT-1由OpenAI于2018年6月11日发布,是首个生成式预训练变换器(GPT),一种基于Transformer (architecture)架构的大型语言模型。它引入了一种半监督方法,将无标注文本上的生成式预训练与针对特定语言任务的判别式微调相结合,显著推动了自然语言处理和人工智能领域的发展。
背景
在2010年代,由改进的机器学习算法、更强大的计算机以及日益增长的数字化数据驱动的人工智能繁荣,促进了人工智能的快速发展。生成式预训练作为一种自监督学习形式,在机器学习中早已确立:模型首先在大型无标注数据集上训练以学习生成数据,然后针对特定任务使用标注数据进行调整。由谷歌研究人员在2017年论文《注意力即你所需要的一切》中引入的transformer架构,通过使用注意力机制一次性处理整个序列,解决了旧式循环神经网络的性能问题,从而支持了更大、更复杂的模型。
历史
2018年6月11日,OpenAI发表了论文《通过生成式预训练提升语言理解》,推出了GPT-1。它是一个仅使用解码器部分的基于transformer的模型,在BookCorpus(一个多样化的文本语料库)上进行预训练以预测下一个词元,随后针对特定任务进行判别式微调。这种半监督方法是一项突破,因为此前表现最佳的神经模型依赖于昂贵的人工标注数据监督学习。2019年2月14日,OpenAI发布了GPT-2,这是一个直接扩展的版本,拥有15亿参数和包含800万个网页的40GB数据集,最初因滥用担忧而分阶段发布。2020年2月10日,微软推出了图灵自然语言生成模型,拥有170亿参数,声称是当时最大的语言模型。2020年5月28日,OpenAI发布了GPT-3,拥有1750亿参数,推进了少样本和零样本学习。继GPT-3之后,OpenAI使用基于人类反馈的强化学习创建了InstructGPT,进而推出了ChatGPT,于2022年11月30日上线,基于GPT-3.5,后来升级为GPT-4(于2023年3月14日发布)。ChatGPT的流行促使谷歌的PaLM和Gemini、Meta AI的Llama等竞争对手相继出现。
基础模型
基础模型是一种在广泛数据上大规模训练的人工智能模型,可适应多种下游任务。基础GPT可以处理文本以外的模态,如图像和音频。一些生成式基于transformer的模型用于文本到图像技术,包括扩散和并行解码,作为开发图像处理系统的视觉基础模型。
高效Transformer架构
transformer模型的计算和内存需求随规模和输入长度显著增加,因为标准自注意力具有二次复杂度。研究人员提出了诸如稀疏注意力机制和内存高效架构等效率改进方案,以降低成本并支持更长的上下文窗口。BigBird、Reformer和FlashAttention等模型展示了结构化注意力模式或优化计算,帮助大型语言模型高效处理长序列。
影响
GPT-1的引入为后续GPT模型奠定了基础,并影响了生成式人工智能的更广泛发展。其半监督方法减少了对标注数据的依赖,使得在大型无标注语料库上进行训练成为可能。GPT-1及其后继者的成功导致基于transformer的模型在从聊天机器人到内容生成的各种应用中广泛采用,并推动了模型扩展、对齐和效率方面的研究。