GPT-2(生成式预训练Transformer 2)是由OpenAI开发的大型语言模型,于2019年2月14日发布。它是OpenAI基础GPT系列中的第二个模型,继GPT-1之后,在GPT-3之前。GPT-2在800万个网页的数据集上进行了预训练,其生成连贯、上下文相关文本的能力被视为生成式人工智能领域的重大进步。该模型在部分发布期间最初被暂缓公开,完整的15亿参数版本直到2019年11月5日才可用。由于其能够翻译语言、回答问题并总结段落,研究人员和评论者强调了其在有益用途和滥用方面的潜力,例如生成垃圾邮件或制造假新闻。
架构
与其前身GPT-1及其后继者一样,GPT-2使用深度学习Transformer (architecture)架构,这是一种神经网络类型,实现了一种称为注意力的机制。这种注意力机制已被证明可以增强涉及序列到序列预测的任务性能。与基于循环或卷积的旧模型不同,Transformer的注意力机制允许模型并行处理输入文本,这可以大幅提高训练和推理速度。该模型的架构被描述为GPT-1的顶级扩展,其参数数量(15亿)和训练数据规模增加了10倍。这种在专用硬件上实现的并行化,使得在比以往可行的更大语料库上进行训练成为可能,这有助于其处理通用机器学习任务的能力。
训练
GPT-2在WebText上进行了训练,这是一个超过100GB的文本语料库,来源于Reddit上在2017年12月之前获得至少3个赞的外链。Reddit被用作人工策划内容的代理,以过滤掉低质量页面。HTML被解析为纯文本,重复链接被消除,并且维基百科页面从训练集中移除,以防止过拟合,因为这些文章经常出现在许多其他数据集中。CommonCrawl尽管规模庞大,但由于其包含大量难以理解的内容而被拒绝。训练GPT-2的基础设施使用了32个TPU v3芯片,运行168小时,计算成本约为43,000美元,据当时与该项目的相关研究人员Andrej Karpathy所述。对于这种规模的模型来说,这相对较低,这得益于Transformer的效率。结果是一个能够生成有时与人类输出难以区分的文本的模型,尽管在较长的段落中可能会变得重复或无意义,这是未来大型语言模型旨在改进的局限性。
部分发布
OpenAI最初决定不立即发布完整模型,是基于该模型可能被用于恶意目的(例如生成垃圾邮件或虚假信息)的担忧。该公司于2019年8月20日发布了一个具有7.74亿参数的版本,约为原始版本大小的一半(也称为774M版本)。这一部分发布旨在让研究人员了解模型行为,同时减轻滥用风险,OpenAI的做法引起了一些研究人员的反对,包括Anima Anandkumar,她声称威胁被夸大了。然而,其他人则认为该模型可能被用来以难以区分的散文填充社交媒体,艾伦人工智能研究所为此构建了一个神经假新闻检测器。
在2019年2月《The Verge》的一篇文章中,James Vincent写道,GPT-2的输出通常明显非人类,但仍然是“语言生成人工智能最令人兴奋的例子”之一。文章展示了,在给定虚假标题的情况下,该模型可以写出文章的其余部分,包含虚假引文和统计数据,甚至可以根据适当的提示编写小说。Vox的Kelsey Piper写道,“我见过的最酷的人工智能系统之一可能也是那个会让我出局的系统;”然而,她以中立的视角描述了其输出。《卫报》将其文本描述为“看似合理的报纸散文。”
尽管部分发布,OpenAI保留了完整模型的代码和语料库。这导致了各种第三方输出。2019年8月,使用OpenWebText制作了自由软件复制品OpenGPT-2,计算成本约为50,000美元。这说明了模型初始发布后随之而来的开放研究和开发。
伦理与社会影响
延迟完整发布GPT-2的决定引发了关于人工智能技术风险和益处的公开辩论。一些研究人员对感知到的危险不以为然,指出威胁可以得到缓解,而另一些人则警告即将到来的合成文本洪流可能淹没真实的人类言论。甚至还有一个微调模型的部分发布,用于生成正面或负面的产品评论,这展示了可能的垃圾邮件潜力。为了回应炒作和开放政策,一组研究人员发表了一封公开信,要求完全发布,声称语言模型并不像它们被描绘的那样具有威胁性,并引用了Photoshop和印刷机等技术,这些技术曾被滥用但也已融入日常生活。
暂缓发布的长期影响是提高了公众对大型语言模型及其能力的认识。GPT-2最终被用作人工智能安全方面的焦点,影响了后续的开源模型。它随后被GPT-3和GPT-4取代;截至2024年,不再开源的GPT-3和GPT-4已变得更加突出。这一事件为在开发强大AI系统时如何平衡透明度和预防措施提供了重要的参考点。
遗产
GPT-2代表了深度学习领域的重大发展,成为后续语言模型的基准。其作为通用学习者的能力,依赖于对序列中下一项的预测,而非任务特定数据,是后续Transformer模型的基本步骤。该模型的参数数量和训练语料库规模为扩展神经网络模型确立了路径。因此,生成式人工智能的计算需求有所增加,GPT-2被认为是人工智能历史上的一个里程碑。其训练原则继续影响着多个领域大型语言模型的开发和架构,该模型仍然是理解涌现和机器学习的深入研究参考点。