译自英文

GPT-5是OpenAI开发的多模态大型语言模型,于2025年8月7日推出,作为GPT-4的继任者。它采用多模型与路由器系统,具备编码、数学和多模态理解能力。

GPT-5是由OpenAI开发的多模态大型语言模型,是其生成式预训练变换器(GPT)基础模型系列中的第五代。该系列的前一代是GPT-4,GPT-5于2025年8月7日发布。它向聊天机器人产品ChatGPT和Microsoft Copilot的用户公开提供,同时开发者也可通过OpenAI API访问。

GPT-5代表了生成式人工智能领域的重大进步,建立在大型语言模型变换器架构的基础之上。其发布标志着人工智能系统在增强推理和多模态能力方面的持续发展中的一个里程碑。

背景

2023年4月14日,OpenAI首席执行官山姆·奥特曼在麻省理工学院的一次活动中发表讲话,表示公司当时并未训练GPT-5。他表示,OpenAI“优先推进GPT-4的开发”,并且“我们目前不会,且在一段时间内也不会”发布GPT-5。7月18日,OpenAI在美国申请了“GPT-5”商标。11月13日,奥特曼向《金融时报》确认公司正在开发GPT-5。

据《The Information》报道,“在2024年下半年的大部分时间里,OpenAI一直在开发一个内部代号为Orion、旨在成为GPT-5的模型”,“但Orion项目未能产出更好的模型,公司反而于2025年2月将其作为GPT-4.5发布。”到2025年7月下旬,外界普遍预期OpenAI计划在8月初发布GPT-5。7月30日,《The Verge》报道称,“微软正在为GPT-5做准备”,因为“熟悉微软AI计划的消息人士”告诉一位编辑,该公司正在测试其Copilot聊天机器人的一种新模式,该模式将提供一种“根据任务深度思考或快速响应”的模型。8月5日,在GPT-5发布前夕,OpenAI发布了GPT-OSS,这是一组具有推理能力的两个开放权重模型。随后,GPT-5于8月7日在直播活动中正式亮相。

能力

在发布时,GPT-5在测试数学、编程、金融和多模态理解的基准测试中表现出最先进的性能。据OpenAI称,与前代模型相比,其改进包括更快的响应时间、更好的编码和写作技能、对健康问题更准确的回答,以及更低的幻觉水平。此外,与前代模型相比,GPT-5旨在对潜在有害的查询给出安全、高水平的回应,而不是直接拒绝,这种方法被OpenAI称为“安全完成”,旨在使“GPT-5能够拒绝更多不安全的问题,同时减少对寻求无害信息的用户的拒绝。”此外,GPT-5经过训练,相比前代模型会给出更具批判性、“不那么过分迎合”的回答。

在GPT-5发布前几天,该模型的两位早期测试者表示,他们对它在编码以及解决数学和科学问题方面的能力“印象深刻”。他们认为,该模型相比GPT-4有显著改进,但提升幅度不如从GPT-3到GPT-4那么大。在GPT-5发布前一天的一次新闻发布会上,OpenAI首席执行官山姆·奥特曼称GPT-5是“通往AGI道路上的重要一步”,其中AGI指通用人工智能,即OpenAI所定义的能够执行人类可以完成的任何经济上有价值的任务这一假设性智能水平。据奥特曼称,GPT-5“明显优于”前代模型,在广泛任务中提供“博士级”能力。

GPT-5使用的确切能耗尚未由OpenAI披露。罗德岛大学的研究人员估计,一条中等长度的响应消耗略高于18瓦时,相当于使用白炽灯泡18分钟。

架构

GPT-5是一个包含快速高吞吐量模型、更深层推理模型以及一个实时路由器的系统,该路由器根据对话类型、复杂性、工具需求和明确的用户意图来决定使用哪个模型。奥特曼此前曾批评手动模型选择器过于复杂,暗示需要统一。GPT-5还包含代理功能,通过该功能它可以设置自己的桌面,并使用其浏览器自主搜索与其任务相关的来源。GPT-5系统卡定义了两种快速高吞吐量模型,,gpt-5-main和gpt-5-main-mini,,以及两种思考模型,,gpt-5-thinking和gpt-5-thinking-mini。在OpenAI API中,开发者可以访问思考模型、其迷你版本以及gpt-5-thinking-nano,这是思考模型的一个更小更快的纳米版本。通过API访问的GPT-5版本具有可调的推理努力(低、中、高或最低)和详细程度(低、中或高)。此外,ChatGPT提供对gpt-5-thinking的访问,并带有利用并行测试时计算的设置,称为gpt-5-thinking-pro。

局限性

安全性

安全研究公司Neuraltrust声称在测试GPT-5的第一天内就成功攻破了该模型。根据其报告,它使GPT-5能够生成制造爆炸装置的详细说明。另一家公司SPLX进行了类似测试,并得出了关于GPT-5安全性的类似结论。他们的评估表明,GPT-5存在显著的安全漏洞,可能使其在企业环境中使用不安全。

训练

据AIMultiple称,GPT-5是原生多模态的,这意味着它从一开始就同时针对多种模态(如文本和图像)进行训练,而不依赖已训练的语言或视觉模型。其训练过程包括三个阶段:无监督预训练、监督微调和基于人类反馈的强化学习。预训练使用了包含书籍、文章、网页、学术论文和许可来源的大规模多语言数据集。GPT-5的视觉和文本能力被描述为在整个训练过程中并行发展,这与GPT-4不同。

使用

GPT-5用于ChatGPT。尽管GPT-5对所有ChatGPT用户免费,但Plus用户获得更高的使用限制,而Pro用户则可无限访问GPT-5以及有限访问GPT-5 Pro。较低层级用户按小时响应的标准限制仍然适用。此外,随着GPT-5的推出,ChatGPT的“高级语音模式”被“ChatGPT语音”取代,后者旨在实现更自然的对话。OpenAI表示,“标准语音模式将于2025年9月9日退役,将所有用户统一到ChatGPT语音上”。2025年11月24日,购物研究功能被添加到ChatGPT中,据称这是一个基于gpt-5-thinking-mini进行后训练的迷你模型。

GPT-5也可在Microsoft Copilot中使用,微软表示将把GPT-5整合到其广泛的产品中。据9to5Mac报道,苹果公司计划将该模型整合到其iOS 26、iPadOS 26和macOS Tahoe操作系统中的Apple Intelligence功能中。它也可通过OpenAI API访问。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·openai·generative-ai·multimodal
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史