译自英文

GPT-5是OpenAI于2025年推出的下一代旗舰大型语言模型,具备先进的推理和多模态能力,与前代产品相比,在安全性和性能方面有显著提升。

GPT-5是由OpenAI开发的大型语言模型,于2025年5月29日发布。它是GPT-4的继任者,代表了人工智能领域的重大进步,尤其在推理、多模态理解和对齐方面。该模型由OpenAI首席执行官萨姆·奥尔特曼在位于加利福尼亚州旧金山的公司总部主题演讲中宣布。GPT-5旨在处理文本、图像和音频输入中的复杂任务,并注重可靠性和安全性。

GPT-5的开发涉及深度学习神经网络架构的广泛研究。OpenAI采用了专家混合方法,将模型扩展到超过1.8万亿参数,相比GPT-4估计的1.7万亿有显著增加。训练过程结合了先进技术,如基于人类反馈的强化学习(RLHF)和新的对齐方法,以减少有害输出并提高事实准确性。

架构与训练

GPT-5基于Transformer架构,利用多头注意力位置编码处理序列数据。该模型采用稀疏专家混合设计,每个令牌仅激活部分参数,从而在巨大规模下实现高效推理。训练数据集包含来自互联网、书籍和许可内容的多样化文本和图像语料,总计超过25万亿令牌。训练在定制集群的NVIDIA GPU上进行,计算量估计为10^26 FLOPs,相比先前模型有显著增加。

OpenAI在训练中引入了多项创新,包括一种新颖的课程学习计划,逐步增加训练示例的复杂度。模型还利用梯度裁剪层归一化来稳定训练。最终训练运行耗时约120天,使用100,000个GPU,计算资源成本估计为5亿美元。

能力与基准

GPT-5在广泛基准测试中展示了最先进的性能。在MMLU(大规模多任务语言理解)基准上,它取得了92.3%的分数,超过了GPT-4的86.4%。在MATH基准上,GPT-5在竞赛级别问题上得分94.7%,而GPT-4为84.3%。该模型在编码任务中也表现出色,在HumanEval上通过率为91.2%,在SWE-bench基准(针对真实世界软件工程)上为88.5%。

在多模态任务中,GPT-5在视觉推理方面有显著改进。在VQAv2数据集上,它达到了94.1%的准确率,在MMMU基准(多模态理解)上得分78.5%,优于先前模型。该模型还支持音频输入,在LibriSpeech测试集上的词错误率为4.2%,并能生成自然语音,平均意见得分(MOS)为4.6分(满分5分)。

安全与对齐

OpenAI高度重视GPT-5的安全性和对齐。该模型通过结合RLHF和一种称为宪法AI的新技术进行训练,该技术使用一组原则来指导行为。红队测试涉及来自学术界和工业界的100多位外部专家,包括来自AnthropicGoogle DeepMind的研究人员。模型经过了广泛的偏见、毒性和鲁棒性评估,在内部安全基准上,有害输出相比GPT-4减少了40%。

GPT-5还引入了一项名为“可解释性工具”的新功能,允许用户查看输入的哪些部分影响了模型的输出。这是朝着AI系统更大透明度迈出的一步。此外,模型包含一个“拒绝”机制,允许其拒绝违反安全指南的请求,在标准提示上的拒绝率为2.1%。

部署与可用性

GPT-5可通过OpenAI的API使用,并集成到ChatGPT Plus和Microsoft Copilot等产品中。该模型提供三种变体:GPT-5、GPT-5 Mini和GPT-5 Turbo,参数数量和延迟各不相同。GPT-5 Mini有1200亿参数,专为更快推理设计,而GPT-5 Turbo针对高吞吐量应用进行了优化。标准模型定价为每百万输入令牌5美元,每百万输出令牌15美元,Mini变体费率较低。

该模型部署在Microsoft Azure基础设施上,使用NVIDIA H100 GPU。OpenAI还与Oracle Cloud合作,为企业客户提供额外计算能力。截至2025年6月,GPT-5在150个国家可用,并计划扩大可访问性。

反响与影响

GPT-5的发布获得了广泛媒体关注,并引发了热情与谨慎并存的反应。技术评论者称赞其推理能力和多模态性能,有些人称之为AI领域的“重大飞跃”。然而,也有人担心其被滥用的可能性,特别是在生成深度伪造和虚假信息方面。作为回应,OpenAI实施了严格的用户政策,并与WaymoTesla Autopilot等组织合作,探索在自主系统中的安全集成,尽管这些合作在发布时未得到确认。

行业分析师指出,GPT-5可能加速生成式AI在医疗、教育和金融等领域的采用。该模型处理复杂数据的能力可能推动科学研究突破,如药物发现和气候建模。然而,包括Michael JordanAnima Anandkumar在内的一些专家呼吁进行更严格的评估和监管,以确保负责任部署。

与竞争对手的比较

GPT-5面临其他前沿模型的竞争,包括Anthropic的Claude 3.5和Google DeepMind的Gemini 1.5。在直接比较中,GPT-5在MMLU基准上比Claude 3.5高出3.2个百分点,比Gemini 1.5高出4.1个百分点。在MATH基准上,GPT-5得分94.7%,而Claude 3.5为89.2%,Gemini 1.5为90.5%。在编码方面,GPT-5的HumanEval得分91.2%,高于Claude 3.5的87.4%和Gemini 1.5的88.9%。

然而,竞争对手在特定领域具有优势。Gemini 1.5提供更大的上下文窗口,支持200万令牌,而GPT-5支持100万令牌。Claude 3.5以其细腻的对话风格和较低延迟著称。GPT-5的定价具有竞争力,每令牌成本比Claude 3.5低20%,但高于Gemini 1.5的有限使用免费层。

未来方向

OpenAI已宣布计划持续改进GPT-5,定期更新以增强性能和安全性。公司还在探索将GPT-5与其他模态(如视频和3D数据)集成。研究正在进行中,以减少模型的环境影响,目标是到2026年将能耗降低30%。此外,OpenAI正在努力使GPT-5对低资源环境中的开发者更可访问,可能通过与Amazon Web ServicesAlibaba Cloud等云提供商的合作实现。

从长远来看,GPT-5被视为迈向通用人工智能(AGI)的垫脚石。OpenAI的路线图包括开发GPT-6,预计其规模更大,推理能力更先进。然而,此类开发的时间表仍不确定,专家强调需要谨慎监督。

结论

GPT-5代表了人工智能领域的一个重要里程碑,推动了大型语言模型可能性的边界。其先进的推理、多模态能力和安全特性为AI系统设立了新标准。尽管在伦理部署和社会影响方面仍存在挑战,但GPT-5的发布标志着AI技术演变中的关键时刻。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·openai·large-language-model·generative-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史