OpenAI GPT-5发布

译自英文

GPT-5是OpenAI开发的多模态大型语言模型,于2025年8月7日发布,作为GPT-4的继任者,具备混合推理、工具使用以及400K上下文窗口等特性。

GPT-5是由OpenAI开发的多模态大型语言模型,是其生成式预训练Transformer(GPT)基础模型系列中的第五代。该系列的前代模型为GPT-4,GPT-5于2025年8月7日发布。公众可通过聊天机器人产品ChatGPT和Microsoft Copilot访问该模型,开发者也可通过OpenAI API使用。GPT-5被设计为一种混合推理系统,结合了快速、高吞吐量的响应与更深层次、更审慎的思考,并支持40万token的上下文窗口,能够处理长篇文档和复杂任务。

背景

GPT-5的开发过程伴随着一系列公开声明和内部变动。2023年4月14日,OpenAI首席执行官山姆·奥特曼在麻省理工学院的一次活动中表示,该公司当时并未训练GPT-5。他表示,OpenAI“正优先推进GPT-4的开发”,并且“我们目前没有,也不会在短期内”发布GPT-5。7月18日,OpenAI在美国申请了“GPT-5”商标。11月13日,奥特曼向《金融时报》确认,该公司正在致力于开发GPT-5。

据《The Information》报道,“在2024年下半年的大部分时间里,OpenAI一直在开发一个内部代号为Orion、旨在成为GPT-5的模型”,但“Orion项目未能产生更好的模型,公司反而于2025年2月将其作为GPT-4.5发布”。到2025年7月下旬,外界普遍预期OpenAI计划在8月初发布GPT-5。7月30日,The Verge报道称,“微软正在为GPT-5做准备”,因为“熟悉微软AI计划的消息人士”告诉一位编辑,该公司正在测试其Copilot聊天机器人的一种新模式,该模式将提供一种“根据任务深度思考或快速响应”的模型。8月5日,在GPT-5发布前夕,OpenAI发布了GPT-OSS,这是一组具有推理能力的开放权重模型。随后,GPT-5于8月7日在直播活动中正式亮相。

能力

在发布时,GPT-5在测试数学、编程、金融和多模态理解的基准测试中表现出最先进的性能。据OpenAI称,与前代模型相比,其改进包括更快的响应速度、更好的编码和写作技能、更准确的健康问题回答以及更低的幻觉水平。此外,与前代模型相比,GPT-5旨在对潜在有害的查询给出安全、高水平的回应,而不是直接拒绝,OpenAI将这种方法称为“安全补全”,旨在“使GPT-5能够拒绝更多不安全的问题,同时对寻求无害信息的用户提供更少的拒绝”。另外,GPT-5经过训练,与前代模型相比,能给出更具批判性、“不那么过分迎合”的回答。

在GPT-5发布前几天,该模型的两位早期测试者表示,他们对模型在编码和解决数学及科学问题方面的能力“印象深刻”。他们认为,该模型相比GPT-4有显著改进,但提升幅度不如从GPT-3到GPT-4那么大。在GPT-5发布前一天的一次新闻发布会上,OpenAI首席执行官山姆·奥特曼称GPT-5是“通往AGI道路上的重要一步”,这里指的是通用人工智能,即OpenAI所定义的能够执行人类所能完成的任何经济价值任务的理论智能水平。据奥特曼称,GPT-5“显著优于”前代模型,在广泛任务中提供“博士级”能力。

OpenAI未披露GPT-5使用的确切能耗。罗德岛大学的研究人员估计,一次中等长度的响应消耗略高于18瓦时,相当于使用白炽灯泡18分钟。

架构

GPT-5是一个包含快速、高吞吐量模型、更深层推理模型以及实时路由器的系统,该路由器根据对话类型、复杂度、工具需求和明确的用户意图来决定使用哪个模型。奥特曼此前曾批评手动模型选择器过于复杂,暗示需要统一。GPT-5还包含代理功能,可以自行设置桌面,并使用浏览器自主搜索与其任务相关的来源。GPT-5系统卡定义了两种快速、高吞吐量模型,,gpt-5-main和gpt-5-main-mini,,以及两种思考模型,,gpt-5-thinking和gpt-5-thinking-mini。在OpenAI API中,开发者可以访问思考模型、其迷你版本以及gpt-5-thinking-nano,后者是思考模型的更小、更快的纳米版本。通过API访问的GPT-5版本具有可调的推理努力(低、中、高或最低)和详细程度(低、中或高)。此外,ChatGPT提供对gpt-5-thinking的访问,并带有使用并行测试时计算的设置,称为gpt-5-thinking-pro。

局限性

安全性

安全研究公司Neuraltrust声称在测试该模型的第一天内成功攻破了GPT-5。根据其报告,该公司使GPT-5生成了制造爆炸装置的详细说明。另一家公司SPLX进行了类似测试,并得出了关于GPT-5安全性的类似结论。他们的评估表明,GPT-5存在显著的安全漏洞,可能使其在企业环境中使用不安全。

训练

据AIMultiple称,GPT-5是原生多模态的,这意味着它从一开始就同时基于多种模态(如文本和图像)进行训练,而不依赖已训练的语言或视觉模型。其训练过程包括三个阶段:无监督预训练、监督微调和基于人类反馈的强化学习。预训练使用了包含书籍、文章、网页、学术论文和许可来源的大规模多语言数据集。与GPT-4不同,GPT-5的视觉和文本能力被描述为在整个训练过程中同步发展。

使用

GPT-5用于ChatGPT。虽然GPT-5对所有ChatGPT用户免费,但Plus用户获得更高的使用限制,而Pro用户可无限访问GPT-5,并有限访问GPT-5 Pro。较低层级用户仍适用每小时响应次数的标准限制。此外,随着GPT-5的推出,ChatGPT的“高级语音模式”被“ChatGPT语音”取代,后者旨在实现更自然的对话。OpenAI表示,“标准语音模式将于2025年9月9日退役,将所有用户统一到ChatGPT语音”。2025年11月24日,购物研究功能被添加到ChatGPT,据称这是一个基于gpt-5-thinking-mini进行后训练的迷你模型。

GPT-5也可在Microsoft Copilot中使用,微软表示将把GPT-5整合到其广泛的产品中。据9to5Mac报道,苹果公司计划将该模型整合到其iOS 26、iPadOS 26和macOS Tahoe操作系统中的Apple Intelligence功能中。该模型还可通过OpenAI API访问,允许开发者在其基础上构建应用程序。

反响与影响

GPT-5的发布在Artificial intelligence社区内引起了广泛关注。早期评估强调了其先进的推理和多模态能力,将其定位为当时领先的Large language model。混合架构结合了快速模型和思考模型,被视为对日益增长的高效、强大AI系统需求的回应。然而,Neuraltrust和SPLX提出的安全问题引发了关于在企业环境中部署此类强大模型安全性的辩论。与Microsoft Copilot的整合以及计划中的Apple Intelligence整合,凸显了将Generative AI嵌入主流消费产品的趋势。截至2025年底,GPT-5仍然是关于Machine learning发展轨迹以及通往Artificial intelligence通用智能道路讨论的焦点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·large-language-model·artificial-intelligence·2025-events
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史