GPT-4 2023年3月版本

译自英文

GPT-4是由OpenAI开发的大型语言模型,于2023年3月发布,接替GPT-3.5。它引入了多模态能力并提升了性能,但OpenAI未公开技术细节。它可在ChatGPT和API中使用,后续推出了继任者GPT-4o。

GPT-4是由OpenAI开发的大型语言模型,于2023年3月14日发布,是其GPT基础模型系列中的第四代。它接替了GPT-3.5,之后被GPT-5所取代。与之前的版本不同,GPT-4是一个多模态模型,能够处理文本和图像输入。OpenAI没有公开模型规模、架构或训练硬件等技术细节,理由是竞争和安全方面的考虑。GPT-4最初仅供ChatGPT Plus订阅用户使用,后来通过OpenAI API提供,并有一个支持最多32,000个上下文令牌的版本。2024年5月,OpenAI推出了GPT-4o,这是具有实时音频和视觉能力的后继版本,也向免费用户开放。

背景

OpenAI于2018年推出了第一个GPT模型,基于transformer架构,并在大量书籍语料库上进行训练。次年,GPT-2展示了大规模生成连贯文本的能力。2020年,GPT-3发布,其参数数量是GPT-2的100倍以上,进一步的改进催生了GPT-3.5,为ChatGPT聊天机器人提供支持。GPT-4在此基础上发展,融入了多模态输入和更先进的训练技术。

能力

GPT-4的默认版本具有8K上下文窗口,而特殊API版本支持最多32K令牌。作为多模态模型,它可以接受图像输入,使用户能够上传照片并根据视觉内容获得建议或答案。GPT-4还可以被提示与外部接口交互,例如将查询包含在<search></search>标签内以执行网络搜索,结果会插入到模型的提示中以形成响应。这使得模型能够使用API、生成图像和总结网页。

2023年《自然》杂志的一篇文章报道称,程序员发现GPT-4对编码任务很有用,例如识别错误和提出优化建议,尽管它容易出错。文章中引用的一位生物物理学家指出,将程序从MATLAB移植到Python只需“大约一个小时”,而不是几天。在89个安全场景的测试中,GPT-4生成的代码在5%的情况下容易受到SQL注入攻击,而2021年的GitHub Copilot则为40%。

2023年11月,OpenAI宣布推出GPT-4 Turbo和带视觉功能的GPT-4 Turbo,具有128K上下文窗口和显著降低的定价。

标准化测试中的表现

研究对通过标准化测试运行聊天机器人的可靠性提出了质疑。在托伦斯创造性思维测试中,GPT-4在原创性和流畅性方面得分位于前1%,灵活性得分在93到99百分位之间。

医学应用

来自Microsoft的研究人员对GPT-4进行了医学问题测试,发现无需专门的提示设计,它在USMLE上的得分就超过了及格线20多分,优于GPT-3.5等早期通用模型以及专门针对医学知识微调的模型(如Med-PaLM)。然而,报告警告称,在医学应用中使用大型语言模型存在“重大风险”,包括不准确的建议和幻觉性事实错误。2023年4月,Microsoft和Epic Systems宣布计划为医疗保健提供者提供由GPT-4驱动的系统,用于回答患者问题和分析医疗记录。

GPT-4o

2024年5月13日,OpenAI推出了GPT-4o(“o”代表“omni”),这是GPT-4的后继版本,能够实时处理和生成文本、音频和图像模态的输出。GPT-4o表现出与人类对话相当的快速响应时间,在非英语语言上的性能有所提升,并增强了视觉和音频理解能力。与GPT-4不同,它向免费用户开放。

局限性

与其前身一样,GPT-4已知会产生幻觉,输出可能包含训练数据中不存在的信息或与用户提示相矛盾的内容。它在决策方面也缺乏透明度;当被要求解释其逻辑时,GPT-4提供的事后解释可能不反映实际过程,在许多情况下,这些解释直接与之前的陈述相矛盾。

2023年,研究人员使用ConceptARC基准测试了GPT-4,该基准旨在衡量抽象推理能力,发现它在所有类别上的得分低于33%,而专门模型在大多数类别上得分为60%,人类得分至少为91%。未参与研究的Sam Bowman表示,这些结果可能并不表明缺乏抽象推理,因为该测试是视觉性的,而GPT-4是一个语言模型。

偏见

GPT-4的训练分为两个阶段。首先,它在大型互联网文本数据集上进行训练以预测下一个令牌。其次,使用人类反馈通过基于人类反馈的强化学习对系统进行微调,训练模型拒绝违反OpenAI定义的有害行为(如非法活动、自残或露骨内容)的提示。Microsoft研究人员建议,GPT-4可能表现出认知偏见,如确认偏见、锚定效应和基础率忽视。

训练

OpenAI没有公开GPT-4的训练技术细节。技术报告未指定模型规模、架构或使用的硬件。它描述了在大规模数据集上进行监督学习,随后结合人类和AI反馈进行强化学习的过程,但没有提供数据集构建、计算能力或超参数(如学习率、轮次数量或优化器)的细节。报告将“竞争环境和大规模模型的安全影响”作为这一决定的原因。Sam Altman表示,训练GPT-4的成本超过1亿美元,据Semafor报道。

反响与影响

GPT-4的发布在AI社区及更广泛领域引起了广泛关注。其多模态能力和在基准测试(包括标准化测试和医学考试)上的改进性能被广泛讨论。然而,关于幻觉、偏见和缺乏透明度的担忧依然存在。2023年2月,在正式发布之前,一个早期版本被集成到Bing Chat中,这也引起了审视。GPT-4在2025年从ChatGPT中移除后,仍可在OpenAI API中使用,其后继版本GPT-4o继续发展模型的能力。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·openai·generative-ai·artificial-intelligence
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史