GPT-4是由OpenAI开发的大型语言模型,于2023年3月14日发布,是其GPT基础模型系列中的第四代。它是一个多模态模型,接受文本和图像作为输入,并因在包括标准化测试和编程任务在内的各种基准测试中表现出色而受到关注。OpenAI未公开模型规模、架构或训练硬件等技术细节,理由是竞争和安全方面的考虑。GPT-4的前代是GPT-3.5,后续是GPT-5;一个名为GPT-4V的版本处理图像输入,而更晚的GPT-4o模型(2024年5月)扩展至实时音频和视频处理。GPT-4于2023年2月被整合到微软的Bing Chat中,2023年3月在ChatGPT中发布,并于2025年从ChatGPT中移除,但仍可通过OpenAI的API使用。
背景与发展
OpenAI于2018年推出了第一个GPT模型,基于Transformer架构,在书籍语料库上训练以进行语言理解。GPT-2(2019年)是一个更大的模型,能够生成连贯的文本,而GPT-3(2020年)的参数规模比GPT-2扩大了100倍以上。GPT-3.5为2022年底推出的ChatGPT聊天机器人提供了支持。GPT-4建立在这一系列的基础上,融合了多模态学习、强化学习和安全对齐方面的改进。一个早期版本从2023年2月起在Bing Chat中进行了测试,使微软用户能够在公开发布之前提前使用。
能力与特性
默认的GPT-4模型具有8K token的上下文窗口,一个特殊的API版本支持高达32K token。与前代不同,它可以处理图像,使用户能够上传照片进行分析或提问。该模型可以被提示与外部工具交互,例如使用<search>标签进行网络搜索,使其能够获取实时信息并执行超出文本预测的任务,包括API调用和图像生成。2023年11月,OpenAI宣布了GPT-4 Turbo和带视觉功能的GPT-4 Turbo,以更低的成本提供128K的上下文窗口。
标准化测试中的表现
GPT-4在各种考试中展现了较高的能力。在托兰斯创造性思维测试中,它在原创性和流畅性方面进入了前1%,灵活性得分位于第93至第99百分位之间。微软的研究人员发现,GPT-4在美国执业医师资格考试中的得分超过及格线20多分,在没有进行任何提示工程的情况下,表现优于GPT-3.5和Med-PaLM等专门的医学模型。然而,同一项研究也警告称,由于可能存在不准确和幻觉,在医疗应用中使用存在重大风险。
应用与影响
2023年《自然》杂志的一篇文章强调了GPT-4在编程方面的实用性,例如调试和优化。一位生物物理学家报告称,将一个MATLAB程序移植到Python只花了几个小时,而不是几天。在安全测试中,GPT-4生成存在SQL注入漏洞代码的比例为5%,而GitHub Copilot在2021年的比例为40%。在医疗保健领域,微软和Epic Systems于2023年4月宣布计划使用GPT-4来回答患者查询和分析医疗记录,但也建议保持谨慎。
局限性与风险
GPT-4以产生幻觉而闻名,即生成与训练数据不符或与用户提示相矛盾的输出。其决策过程是不透明的;解释是在事后生成的,可能与此前的陈述相冲突。2023年,ConceptARC基准测试显示GPT-4在抽象推理任务上的得分低于33%,而专门的模型和人类得分更高,尽管怀疑者指出该测试的视觉特性可能对语言模型不利。
偏见与对齐
GPT-4的训练包括两个阶段:首先在互联网文本上进行无监督学习,然后通过基于人类反馈的强化学习来减少有害输出。微软的研究人员提出,它可能表现出认知偏见,如确认偏误、锚定效应和基率忽视,这引发了对其部署公平性的担忧。
训练与技术保密
OpenAI关于GPT-4的技术报告省略了模型规模、架构、硬件、训练数据集的构建、计算能力以及学习率或优化器等超参数。该公司将“竞争格局和安全影响”作为原因。首席执行官Sam Altman表示训练成本超过1亿美元,Semafor的报道显示数字更高,但确切数字仍未得到证实。
后续版本与演进
GPT-4o于2024年5月13日推出,能够以接近人类的响应时间实时处理文本、音频和图像。它改进了非英语语言的性能,并向免费用户开放,这与GPT-4不同。更早推出的GPT-4V专门为GPT-4增加了图像输入功能。该模型的遗产包括推动多模态AI的发展,并引发了关于大型语言模型透明度和安全性的讨论。