GPT-2(2019年)

译自英文

GPT-2是OpenAI于2019年发布的大型语言模型,以其先进的文本生成能力而闻名,并因安全顾虑最初限制发布。

GPT-2(生成式预训练Transformer 2)是由OpenAI开发的大型语言模型,是其基础GPT系列中的第二代迭代。该模型在800万个网页组成的数据集上进行了预训练,并在文本生成、翻译、摘要和问答方面展现了显著进步。由于担心可能被滥用,该模型最初未向公众发布,但最终于2019年11月全面发布。

GPT-2是其前身GPT-1的直接扩展,参数数量和训练数据集规模均增加了十倍。它采用Transformer (architecture)架构,利用注意力机制有选择地关注输入文本的相关部分,从而实现更高的并行化,并超越了以往基于RNN/CNN/LSTM的模型。其通用学习能力使其能够通过准确预测序列中的下一个项目来执行各种任务,但在较长的段落上可能会变得重复或无意义。GPT-2后来被GPT-3和GPT-4等模型取代,这些模型不再开源。

训练与架构

GPT-2的训练利用了Transformer架构的大规模并行化能力,使其能够在比以往自然语言处理模型更大的语料库上进行训练。OpenAI最初考虑了CommonCrawl(一个大型网络爬取语料库),但由于内容难以理解而放弃。相反,他们开发了一个名为WebText的新语料库,该语料库通过抓取2017年12月之前Reddit帖子中至少获得3个karma的链接页面而创建。语料库通过将HTML解析为纯文本、去除重复内容并排除维基百科页面来避免过拟合。

GPT-2的训练成本估计约为43,000美元,基于Andrej Karpathy的声明,使用32个TPU v3芯片运行168小时,每芯片每小时约8美元。其他来源引用成本约为每小时256美元。相比之下,训练BERT和XLNet的成本分别为6,912美元和245,000美元。GPT-2的架构是一个深度神经网络,采用生成式预训练Transformer,实现注意力机制而非循环或卷积。

发布与初步限制

GPT-2于2019年2月14日发布公告。与之前的OpenAI模型不同,源代码并未立即发布,理由是存在恶意使用的风险。有限访问权限被授予选定的新闻媒体,OpenAI展示了一个经过微调以生成产品评论的版本,该版本可能被用于规避垃圾邮件过滤器。Jeremy Howard等研究人员警告称,该模型可能用于填充网络以生成令人信服的散文,而艾伦人工智能研究所则宣布了一种检测“神经假新闻”的工具。

关于威胁的看法存在分歧。一些人(如Anima Anandkumar)称这些限制为“恶意废话”,而《The Gradient》发表了一封公开信,将该技术比作印刷术和Photoshop。尽管存在争议,OpenAI于2019年8月20日发布了包含7.74亿参数的版本,并于2019年11月5日发布了完整的15亿参数模型。

模型变体与复制

GPT-2系列包括四种不同大小的模型,分阶段发布。最小的模型于2019年2月发布,随后是更大的模型。完整的15亿参数模型是最终发布版本。该模型的方法在出版物中进行了描述,允许其他人将其复制为自由软件。其中一个复制品OpenGPT-2于2019年8月发布,附带名为OpenWebText的WebText自由许可版本,计算成本约为50,000美元。

影响与遗产

GPT-2的发布标志着生成式人工智能的一个重要里程碑,展示了大规模Transformer的潜力。其生成连贯文本的能力受到《The Verge》和《The Guardian》等媒体的赞扬,但同时也指出长段落可能变得重复。该模型最初的暂缓发布引发了关于AI研究中开放获取和安全的辩论,影响了未来关于负责任AI开发的讨论。GPT-2后来被GPT-3和GPT-4取代,这些模型继续推动该领域的发展,但不再开源。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·openai·transformer·generative-ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史