GPT-3(生成预训练变换器3)是一个由OpenAI开发的大型语言模型,于2020年5月在一篇题为“语言模型是少样本学习者”的论文中引入,此后在2020年剩余时间内逐步开放更广泛的API访问。与其前身GPT-2类似,GPT-3基于Transformer (architecture)架构构建,并使用自回归的下一词元目标进行训练,但规模大幅扩展至1750亿参数,比GPT-2完整模型大100多倍,训练数据混合了Common Crawl、书籍和维基百科文本。
少样本学习
GPT-3的核心研究贡献在于证明了,一个足够大的语言模型仅需在提示中提供少量示例,无需基于梯度的Fine-tuning,就能执行包括翻译、问答、算术和简单推理在内的广泛任务。这种能力被包括主要作者Tom Brown在内的OpenAI研究人员称为Few-shot learning,更一般地称为In-context learning,这表明仅凭规模就能替代任务特定的训练,这一发现强化了关于语言建模中Scaling laws的新兴观点,并塑造了该领域后续的研究优先事项。
商业发布
OpenAI并未像最终对GPT-2那样公开发布GPT-3的权重,而是从2020年6月起通过付费API独家提供GPT-3,最初以私有测试版形式进行。这一决定确立了一种商业模式,后来在整个行业广泛采用,即前沿语言模型通过按需计费的云服务访问,而非下载并在本地运行,这与后来几年竞争对手发布的Open-weights models模型形成对比。该API迅速吸引了一波基于GPT-3构建产品的初创公司,包括早期的AI写作助手、聊天机器人和代码生成工具,微软还于2020年作为其对OpenAI更广泛投资的一部分,获得了GPT-3底层模型权重的独家许可。
影响与局限
GPT-3在主流媒体和技术媒体上被广泛报道,被视为语言模型正接近质性新能力的证据,它直接推动了使用包括RLHF在内的技术训练的指令微调变体的开发,这项工作最终促成了2022年11月发布的基于GPT-3.5变体的ChatGPT。GPT-3也因倾向于产生流畅但事实错误的输出而受到大量批评,这是该领域后来称为Hallucination (AI)的现象的早期突出例子,同时还因复现训练数据中的偏见而受到批评。其继任者GPT-4于2023年3月发布,具有大幅扩展的能力,包括多模态输入。