生成式预训练Transformer 2(GPT-2)是由OpenAI开发的大型语言模型,也是其GPT基础系列中的第二个模型。它在一个包含800万个网页的数据集上进行了预训练,并于2019年2月部分发布,随后于2019年11月5日完整发布了15亿参数版本。GPT-2是其前身GPT-1的直接扩展,参数数量和训练数据集规模均增加了十倍。它是一个通用学习器,其执行各种任务的能力源于其准确预测序列中下一项的一般能力,这使其能够翻译文本、回答问题、总结段落,并生成有时与人类写作难以区分的文本输出,尽管在长段落中可能会变得重复或无意义。
GPT-2与其前身和后续模型一样,采用生成式预训练Transformer (architecture)架构,实现了一个深度神经网络,该网络依赖注意力机制而非较旧的基于循环和卷积的架构。这使得模型能够选择性地关注相关输入片段,并大幅提高并行化程度,超越了此前基于RNN/CNN/LSTM模型的基准。它已被GPT-3和GPT-4取代,后者不再开源。
训练
由于Transformer (architecture)架构实现了大规模并行化,GPT模型可以在比以往自然语言处理模型更大的语料库上进行训练。虽然GPT-1证明了该方法的可行性,但GPT-2探索了在极大语料库上训练的网络的新兴特性。CommonCrawl(一个大型网络爬取语料库)曾被考虑,但因含有大量难以理解的内容而被否决。相反,OpenAI开发了一个名为WebText的新语料库,通过仅抓取2017年12月前Reddit帖子中至少获得3个赞的链接页面生成。该语料库通过将HTML解析为纯文本、消除重复页面以及移除维基百科页面以避免过拟合进行了清理。
关于训练成本的文档有限。根据Andrej Karpathy的声明,GPT-2在32个TPU v3芯片上训练了168小时(7天),每个TPU v3每小时约8美元,总计算成本约为43,000美元。其他来源引用的训练成本约为每小时256美元。类似模型如BERT和XLNet分别消耗了6,912美元和245,000美元的资源。
发布
GPT-2于2019年2月14日首次公布。2019年2月《The Verge》的一篇文章由James Vincent撰写,指出虽然其生成的写作通常容易被识别为非人类,但它仍然是语言生成程序中最令人兴奋的例子之一。《卫报》将其输出描述为看似合理的报纸散文,Vox的Kelsey Piper称其是她见过的最酷的人工智能系统之一。《The Verge》强调了其在翻译文本、总结文章和回答琐事问题方面的灵活性。GPT-2系列包含四个模型,在论文中有所报告,但并非一次性发布,而是分阶段发布。
限制和部分发布
与之前的OpenAI模型不同,OpenAI最初拒绝公开发布GPT-2的源代码,理由是存在恶意使用的风险。仅允许选定的新闻媒体有限访问。一个理由是生成的文本可能被垃圾邮件发送者用来规避过滤器;OpenAI展示了一个微调版本,可生成无限的正向或负向产品评论。另一个理由是可能生成淫秽或种族主义文本。像Jeremy Howard这样的研究人员警告称,该技术可能使社交媒体充满听起来合理的散文,艾伦人工智能研究所宣布了一种检测神经假新闻的工具。
意见存在分歧。2019年2月《The Verge》的一篇文章认为威胁被夸大了。加州理工学院教授兼Nvidia机器学习研究总监Anima Anandkumar表示,没有证据表明GPT-2构成所述威胁,并将拒绝行为描述为开放的对立面。《The Gradient》发表了一封公开信,要求公开发布,将威胁比作印刷机,并引用Photoshop作为尽管具有混乱潜力但未摧毁社会的技术示例。
774M发布
虽然OpenAI未发布完全训练的模型或语料库,但对方法的描述和底层技术的免费可用性使其他人能够复制。一个复制品OpenGPT-2于2019年8月发布,附带一个自由许可的WebText版本,称为OpenWebText,云计算成本约为50,000美元。2019年8月20日,OpenAI发布了GPT-2的部分版本,包含7.74亿参数,约为完整模型大小的一半,随后于2019年11月5日发布了完整的15亿参数版本。
影响和遗产
GPT-2的分阶段发布引发了人工智能社区关于AI安全和开放性的辩论。它证明了大规模深度学习模型可以在没有显式训练的情况下执行多项任务,影响了后续生成式人工智能研究。该模型的架构和训练方法成为后续发展的基础,包括GPT-3及以后,其发布策略为OpenAI和其他组织(如Anthropic和Google DeepMind)处理强大语言模型部署设定了先例。GPT-2还突出了滥用的可能性,导致检测工具的开发以及关于负责任AI出版的讨论。
技术细节
GPT-2模型使用仅解码器的transformer架构,具有多头注意力和位置编码。它使用Adam优化器进行训练,并采用学习率调度和梯度裁剪。模型大小从1.17亿到15亿参数不等,最大版本使用48层和1600维嵌入。在推理期间,GPT-2采用top-k采样和温度缩放来生成多样化的文本。其训练数据WebText旨在避免不加选择地网络爬取的噪声,专注于来自Reddit的高质量、人工策划的链接。
接受度和批评
最初的接受度褒贬不一,对其技术成就的赞扬和对受限发布的批评并存。一些研究人员认为安全担忧被夸大了,而另一些则支持谨慎的方法。该模型从最小提示生成连贯文本的能力被视为机器学习的重要进步,但其局限性(如长输出中的重复)也被指出。GPT-2的发布影响了后续的开源努力和围绕AI治理的政策讨论,为更广泛的人工智能伦理领域做出了贡献。