InstructGPT是由OpenAI开发的一系列大型语言模型,于2022年1月首次推出。与早期的GPT-3模型相比,这些模型旨在更好地遵循用户指令并与人类意图保持一致。它们采用了一种称为基于人类反馈的强化学习(RLHF)的训练技术,其中人类评分者对模型输出进行排序,并引导模型生成更有帮助、更真实且危害更小的响应。
InstructGPT建立在生成式预训练变换器(GPT)架构的基础上,这是一种源于2017年引入的变换器架构的变换器模型。最初的GPT-3由OpenAI于2020年发布,是一个具有1750亿参数的仅解码器变换器,但它有时会产生偏离任务或与用户意图不一致的输出。InstructGPT旨在通过利用人类反馈精炼模型来纠正这些问题。
训练与方法
InstructGPT模型是通过监督学习微调GPT-3,然后应用基于人类反馈的强化学习而创建的。人类评分者被要求比较不同模型生成的响应,他们的偏好被用于训练一个奖励模型。随后,策略(即模型)被更新以最大化该奖励,同时加入对偏离原始GPT-3分布的惩罚,以避免过度漂移。
OpenAI报告称,InstructGPT模型在遵循指令方面显著优于GPT-3,生成更少的虚构事实(一种称为幻觉的现象),并产生略微较少的有害内容,同时在摘要和问答等某些任务上也表现出改进的性能。
能力与局限性
InstructGPT继承了GPT-3的核心能力,包括生成连贯文本、回答问题、翻译语言和编写代码。它还能处理少样本和零样本提示。然而,与其前身一样,当被提示有毒输入时,它仍可能生成有害或有偏见的内容。OpenAI为使用API的开发人员实施了内容审核工具,截至2022年1月,InstructGPT成为OpenAI API客户的默认模型。
与前代模型的比较
与原始GPT-3模型相比,InstructGPT在用户意图对齐方面表现出显著改进,这一点通过人类评估得到证实。例如,在机器学习研究中,评估者判断InstructGPT的输出在各种提示下比GPT-3更受青睐,包括减少意外的离题响应。尽管如此,InstructGPT仍保留了大型语言模型常见的局限性,如对措辞的敏感性和偶尔的事实错误。
InstructGPT的开发反映了生成式人工智能的更广泛趋势,其中模型被训练以更好地符合人类伦理和安全标准。这种方法影响了后续模型,如ChatGPT,后者使用了类似的对齐方法。
接受度与影响
InstructGPT为日益增长的专注于有益且安全AI的模型生态系统做出了贡献。其他组织的研究人员,如Anthropic和Google DeepMind,也探索了类似的对齐技术。该模型是迈向更实用AI助手的一步,但也引发了关于AI生成错误信息风险以及AI系统透明性重要性的讨论。截至2025年,OpenAI继续迭代对齐技术,在InstructGPT建立的基础上进一步发展。