GPT-4是由OpenAI开发的大型语言模型,是其GPT基础模型系列中的第四代。它于2023年3月14日发布,接替了GPT-3.5,随后被GPT-5取代。与前代不同,GPT-4是多模态的,意味着它可以同时处理文本和图像输入。OpenAI未披露模型规模、架构或训练硬件等技术细节,理由是竞争和安全方面的考虑。早期版本于2023年2月集成到微软的Bing Chat中,GPT-4从2023年3月起在ChatGPT中可用,直到2025年被移除;它仍可通过OpenAI的API访问。
背景
OpenAI于2018年推出了首个GPT模型,基于Transformer (architecture)架构,并在大量书籍语料库上进行训练。2019年,GPT-2问世,能够大规模生成连贯文本。2020年,GPT-3发布,其参数数量是GPT-2的100多倍,其改进版本GPT-3.5为ChatGPT聊天机器人提供了支持。GPT-4在此基础上发展,增加了多模态能力,并在许多基准测试中提升了性能。
能力
默认版本的GPT-4具有8K上下文窗口,而特殊API变体支持最多32K个标记。作为多模态模型,它可以接受图像输入,使用户能够上传照片进行分析或获取建议。GPT-4还可以与外部接口交互,例如通过将查询括在特定标签中执行网络搜索,从而访问和总结网页、使用API以及生成图像。2023年《自然》杂志的一篇文章指出,程序员发现GPT-4在编码辅助方面很有用,例如识别错误和提出优化建议,尽管它容易出错。在安全测试中,GPT-4在5%的场景中产生了易受SQL注入攻击的代码,而2021年GitHub Copilot的比例为40%。2023年11月,OpenAI发布了GPT-4 Turbo,具有128K上下文窗口和更低的定价。
在标准化测试中的表现
研究对通过标准化测试评估聊天机器人的可靠性提出了质疑。在托兰斯创造性思维测试中,GPT-4在原创性和流畅性方面得分位于前1%,灵活性得分在93至99百分位之间。
医学应用
微软研究人员发现,GPT-4在无需专门提示的情况下,USMLE考试得分超过及格线20多分,优于GPT-3.5和医学专用模型如Med-PaLM。然而,他们警告存在重大风险,包括不准确的建议和幻觉。2023年4月,微软和Epic Systems宣布计划为医疗保健提供者提供由GPT-4驱动的系统,用于患者查询和医疗记录分析。
GPT-4o
2024年5月13日,OpenAI推出了GPT-4o(“o”代表“omni”),这是一个继任者,能够实时处理和生成文本、音频和图像模态。它提供了与人类对话相当的响应时间,改进了非英语语言性能,并增强了视觉和音频理解能力。与GPT-4不同,GPT-4o也可供免费用户使用。
局限性
GPT-4与其前代一样,可能会产生幻觉,生成与训练数据或用户提示相矛盾的输出。它还缺乏决策透明度;解释是事后形成的,可能与前陈述相矛盾。2023年,使用ConceptARC基准测试显示,GPT-4在抽象推理任务上的得分低于33%,而专用模型得分约为60%,人类至少为91%。研究人员指出,这可能并不表明缺乏抽象推理能力,因为该测试是视觉性的,而GPT-4是语言模型。
偏见
GPT-4的训练分为两个阶段:首先,在大型互联网文本数据集上进行训练以预测下一个标记;其次,使用基于人类反馈的强化学习来符合安全指南。微软研究人员建议,GPT-4可能表现出认知偏见,如确认偏见、锚定效应和基础率忽视。
训练
OpenAI未发布GPT-4训练的技术细节,包括模型规模、架构、硬件或超参数。技术报告描述了监督学习和强化学习与人类及AI反馈的结合,但省略了具体细节。Sam Altman表示训练成本超过1亿美元。报告将竞争环境和安全影响列为不披露信息的原因。