GPT-5是由OpenAI开发的多模态大型语言模型,是其生成式预训练变换器(GPT)基础模型系列中的第五代。该系列的前一代是GPT-4,GPT-5于2025年8月7日发布。它向聊天机器人产品ChatGPT和Microsoft Copilot的用户公开提供,同时开发者也可通过OpenAI API访问。此次发布标志着生成式AI发展的重要一步,重点在于实时多模态理解和智能体能力。
同年,Google DeepMind推出了Astra,也称为Gemini Live,这是一款实时多模态AI助手,在消费市场和企业市场中直接与GPT-5竞争。Astra于2025年发布,强调与视觉和听觉输入的 seamless 交互,定位为OpenAI产品的关键竞争对手。本文主要聚焦于GPT-5,并在相关背景下提及Astra。
背景
2023年4月14日,OpenAI首席执行官Sam Altman在麻省理工学院的一次活动中表示,该公司当时并未训练GPT-5。他表示,OpenAI“优先发展GPT-4”,并且“我们目前没有,也不会在短期内”发布GPT-5。7月18日,OpenAI在美国申请了“GPT-5”商标。11月13日,Altman向《金融时报》确认,公司正在开发GPT-5。
据《The Information》报道,“在2024年下半年的大部分时间里,OpenAI一直在开发一个内部代号为Orion的模型,并计划将其作为GPT-5发布”,“但Orion项目未能产生更好的模型,公司反而在2025年2月将其作为GPT-4.5发布。”到2025年7月下旬,外界普遍预期OpenAI计划在8月初发布GPT-5。7月30日,《The Verge》报道称,“微软正在为GPT-5做准备”,因为“熟悉微软AI计划的消息人士”告诉一位编辑,该公司正在测试其Copilot聊天机器人的新模式,该模式将提供一种“根据任务深度思考或快速响应”的模型。8月5日,在GPT-5发布前夕,OpenAI发布了GPT-OSS,这是一组具有推理能力的开放权重模型。随后,GPT-5于8月7日在直播活动中正式亮相。
能力
在发布时,GPT-5在测试数学、编程、金融和多模态理解的基准测试中表现出最先进的性能。据OpenAI称,与其前代模型相比,其改进包括更快的响应时间、更好的编码和写作技能、更准确的健康问题回答以及更低的幻觉水平。此外,与之前的模型相比,GPT-5旨在对潜在有害的查询提供安全、高水平的响应,而不是直接拒绝,OpenAI将这种方法称为“安全完成”,旨在“使GPT-5能够拒绝更多不安全的问题,同时减少对寻求无害信息的用户的拒绝。”此外,GPT-5经过训练,相比前代模型,能给出更批判性、“不那么过分迎合”的回答。
在GPT-5发布前几天,两位早期测试者表示,他们对模型在编码和解决数学及科学问题方面的能力“印象深刻”。他们认为,该模型相比GPT-4有显著改进,但不如从GPT-3到GPT-4的提升幅度大。在GPT-5发布前一天的一次新闻发布会上,OpenAI首席执行官Sam Altman称GPT-5是“通往AGI道路上的重要一步”,AGI指人工通用智能,即OpenAI定义为能够执行人类能完成的任何经济价值任务的理论智能水平。据Altman称,GPT-5“明显优于”其前代,在广泛任务中提供“博士级”能力。
GPT-5使用的确切能耗尚未由OpenAI披露。罗德岛大学的研究人员估计,一次中等长度的响应消耗略超过18瓦时,相当于使用白炽灯泡18分钟。
架构
GPT-5是一个系统,包含一个快速、高吞吐量的模型,一个更深层的推理模型,以及一个实时路由器,根据对话类型、复杂性、工具需求和明确的用户意图来决定使用哪个模型。Altman此前曾批评手动模型选择器过于复杂,暗示需要统一。GPT-5还包括智能体功能,通过该功能,它可以设置自己的桌面,并使用浏览器自主搜索与其任务相关的来源。GPT-5系统卡定义了两种快速、高吞吐量的模型,,gpt-5-main和gpt-5-main-mini,,以及两种思考模型,,gpt-5-thinking和gpt-5-thinking-mini。在OpenAI API中,开发者可以访问思考模型、其迷你版本以及gpt-5-thinking-nano,这是思考模型的一个更小、更快的纳米版本。通过API访问的GPT-5版本具有可调的推理努力(低、中、高或最低)和冗长程度(低、中或高)。此外,ChatGPT提供gpt-5-thinking的访问,并带有使用并行测试时计算的设置,称为gpt-5-thinking-pro。
安全性与局限性
安全研究公司Neuraltrust声称在测试GPT-5的第一天内成功攻破了该模型。根据其报告,它使GPT-5能够生成制造爆炸装置的详细说明。另一家公司SPLX进行了类似测试,并得出了关于GPT-5安全性的类似结论。他们的评估表明,GPT-5存在显著的安全漏洞,可能使其在企业环境中使用不安全。
尽管存在这些担忧,OpenAI仍强调其安全措施,包括“安全完成”方法和诸如基于人类反馈的强化学习等对齐技术。然而,外部研究人员强调的安全漏洞表明,在确保先进AI系统的稳健安全性方面仍存在持续挑战。
训练
据AIMultiple称,GPT-5是原生多模态的,这意味着它从一开始就同时基于多种模态(如文本和图像)进行训练,而不依赖已训练的语言或视觉模型。其训练过程包括三个阶段:无监督预训练、监督微调和基于人类反馈的强化学习。预训练使用了大规模多语言数据集,包括书籍、文章、网页、学术论文和许可来源。与GPT-4不同,GPT-5的视觉和文本能力被描述为在整个训练过程中并行发展。
训练过程利用了变换器架构和大型语言模型技术的进步,包括多头注意力和位置编码。数据增强和模型剪枝的使用也促进了模型的效率和性能。
使用与集成
GPT-5用于ChatGPT。虽然GPT-5对所有ChatGPT用户免费,但Plus用户获得更高的使用限制,而Pro用户则获得GPT-5的无限访问权限以及GPT-5 Pro的有限访问权限。较低层级用户每小时响应次数的标准限制仍然适用。此外,随着GPT-5的推出,ChatGPT的“高级语音模式”被“ChatGPT语音”取代,后者旨在实现更自然的对话。OpenAI表示,“标准语音模式将于2025年9月9日退役,将所有用户统一到ChatGPT语音上。”2025年11月24日,ChatGPT增加了购物研究功能,据称是一个基于gpt-5-thinking-mini进行后训练的迷你模型。
GPT-5也可在Microsoft Copilot中使用,微软表示将把GPT-5整合到其广泛的产品中。据9to5Mac报道,苹果公司计划将该模型集成到其iOS 26、iPadOS 26和macOS Tahoe操作系统中的Apple Intelligence功能中。它还可通过OpenAI API访问,允许开发者在其基础上构建应用程序。
相比之下,谷歌的Astra(Gemini Live)已集成到谷歌生态系统中,包括Android和Google Assistant,并提供类似的实时多模态能力。OpenAI与Google DeepMind之间的竞争加速了该领域的创新,两家公司都在推动AI助手的边界。
影响与反响
GPT-5的发布对AI行业产生了重大影响。其在基准测试中的最先进性能为人工智能系统设定了新标准。该模型在多个领域处理复杂任务的能力受到早期测试者的称赞,但一些人指出,相比GPT-4的改进不如从GPT-3到GPT-4的飞跃那么显著。
批评者对GPT-5的安全性和保障性提出了担忧,特别是考虑到Neuraltrust和SPLX报告的漏洞。这些问题凸显了继续研究AI安全和对齐的必要性,这一领域涉及Joshua Tenenbaum和Melanie Mitchell等专家。
尽管存在这些挑战,GPT-5预计将推动AI在教育、医疗保健和软件开发等各个领域的广泛采用。其集成到Microsoft Copilot和Apple Intelligence等产品中表明,它将成为消费者和企业的普遍工具。
结论
GPT-5代表了生成式AI和大型语言模型发展的一个重要里程碑。其于2025年8月7日与谷歌的Astra一同发布,标志着实时多模态AI助手的新时代。尽管在安全和能耗方面仍存在挑战,但GPT-5的能力展示了该领域的快速进展。随着AI的持续发展,像GPT-5这样的模型很可能在塑造技术和社会的未来中发挥核心作用。