GPT-2(生成式预训练变压器2)是由OpenAI开发的一种大型语言模型,于2019年2月首次公布。基于Transformer (architecture)架构,GPT-2在WebText(一个包含约800万个网页的数据集)上训练,采用纯粹的自回归下一个词元预测目标,直接延续了2018年发布的较小原始GPT模型。
分阶段发布
GPT-2广为人知,主要并非因其架构,而是因为OpenAI的发布方式。完整模型包含15亿个参数,在当时对公开语言模型而言规模异常庞大,并能从简短提示生成连贯的多段落文本,其流畅性令许多研究人员感到惊讶。出于对恶意用途(如大规模生成假新闻、垃圾邮件和冒充他人)的担忧,OpenAI最初拒绝发布完整的15亿参数模型,仅发布较小版本,同时研究潜在滥用情况。这一决定被公开表述为模型“过于危险而无法发布”,引起了研究界部分人士的强烈批评,他们认为这要么过于谨慎,要么是营销策略,要么为扣留研究结果树立了尴尬先例。OpenAI逐步逆转了这一立场,在2019年11月发布完整的15亿参数模型,此前其分阶段发布研究报告称,在该规模下未发现其曾担忧的滥用的有力证据。
重要性
GPT-2是首批展示强大零样本任务性能的模型之一,无需任务特定的微调,仅通过自然语言示例提示,即可生成摘要、翻译和问题答案,这为其后继者GPT-3中后来被正式化的少样本学习和上下文学习提供了早期例证。其规模约为原始GPT的十倍,也为研究人员后来更正式描述的缩放定律提供了早期数据点:即增加模型和数据大小可预测地改善语言建模性能。
遗产
GPT-2的发布策略成为AI治理和AI安全辩论中被广泛引用的案例研究,预示了后来围绕开放与封闭模型发布更持久的争论,这些争论随着Llama及其他开放权重模型的出现而重新浮现。在OpenAI自身的产品线中,GPT-2的架构和训练方法直接构成了GPT-3的基础,后者于次年发布,参数数量超过其100倍,并最终促成了ChatGPT产品,使GPT系列在2022年引起主流关注。研究员Alec Radford及OpenAI同事被认为是GPT-2的主要作者。