译自英文

OpenAI o3是一个生成式预训练Transformer(GPT)推理模型,于2024年12月20日发布,作为OpenAI o1的继任者,旨在花费更多时间进行逐步逻辑推理的深思熟虑。其发布版本包括o3-mini、o3、o4-mini和o3-pro。

OpenAI o3是由OpenAI开发的生成式预训练变换器(GPT)模型,作为OpenAI o1的继任者用于ChatGPT。它旨在回答需要逐步逻辑推理的问题时投入额外的思考时间。该模型于2024年12月20日发布,随后推出了多个变体,包括o3-mini、o3、o4-mini和o3-pro,具备编码、数学和科学方面的能力。

选择“o3”而非“o2”这一名称,是为了避免与移动运营商品牌O2产生商标冲突。OpenAI邀请安全与安保研究人员在2025年1月10日前申请提前访问这些模型。与其前身o1类似,最初的发布包含两个模型:o3和o3-mini。

历史

OpenAI o3模型于2024年12月20日发布。2025年1月31日,OpenAI向所有ChatGPT用户(包括免费用户)及部分API用户发布了o3-mini。OpenAI将o3-mini描述为针对“需要精确性和速度的技术领域”的o1“专业替代方案”。o3-mini提供三种推理努力级别:低、中、高。免费版本使用中级,而使用更多计算资源的变体(称为o3-mini-high)可供付费订阅者使用。ChatGPT Pro级别的订阅者可无限访问o3-mini和o3-mini-high。

2025年2月2日,OpenAI推出了OpenAI Deep Research,这是一项ChatGPT服务,使用o3的一个版本,基于网络搜索在5至30分钟内生成综合报告。2月6日,面对DeepSeek R1等竞争对手的压力,OpenAI宣布了一项更新,旨在增强其o3-mini模型思维过程的透明度。2月12日,OpenAI进一步提高了o3-mini-high的速率限制,ChatGPT Plus订阅者每天可请求50次(此前为每周50次),并实现了文件和图像上传支持。

2025年4月16日,OpenAI发布了o3和o4-mini,后者是o3-mini的继任者。2025年6月10日,OpenAI发布了o3-pro,该公司声称这是其迄今最强大的模型。OpenAI表示:“我们建议将其用于可靠性比速度更重要的棘手问题,等待几分钟是值得的权衡。”2026年5月28日,OpenAI宣布o3将于2026年8月26日从ChatGPT中退役,此前有90天的日落期。该公司表示,这一变更仅适用于ChatGPT,不影响API。

能力

OpenAI使用强化学习来教导o3在生成答案前“思考”,采用其所谓的“私有思维链”。这种方法使模型能够提前规划并推理任务,执行一系列中间推理步骤以帮助解决问题,代价是额外的计算能力和更高的响应延迟。

o3在复杂任务上的表现显著优于o1,包括编码、数学和科学。OpenAI报告称,o3在GPQA Diamond基准上取得了87.7%的分数,该基准包含无法在线公开获取的专家级科学问题。在SWE-bench Verified(一个评估解决真实GitHub问题能力的软件工程基准)上,o3得分71.7%,而o1为48.9%。在Codeforces上,o3达到2727的Elo评分,而o1为1891。在用于人工通用智能的抽象与推理语料库(ARC-AGI)基准上,该基准评估AI处理新逻辑和技能获取问题的能力,o3的准确率是o1的三倍。

模型变体

o3系列包含多个针对不同用例定制的变体。o3-mini是一个更小、更快的模型,专为需要精确性和速度的技术领域设计,具有可调的推理努力级别。o3是完整规模的模型,在复杂基准上性能更高。o4-mini于2025年4月16日与o3一同发布,作为o3-mini的继任者。o3-pro于2025年6月10日发布,定位为最强大的模型,优先考虑可靠性而非速度。

每个变体都利用相同的底层架构,即基于变换器架构的大型语言模型,采用深度学习技术和神经网络进行推理。这些模型使用强化学习进行训练,并整合了私有思维链,这是一种不完全对用户透明的思维链推理形式。

性能与基准

o3的性能指标凸显了其相对于先前模型的进步。在GPQA Diamond上,o3得分87.7%,表明其在专家级科学问题上的强劲表现。在SWE-bench Verified上,o3达到71.7%,较o1的48.9%有显著提升,展示了其解决现实世界软件工程问题的能力。在Codeforces上,o3的Elo评分2727远超o1的1891,反映了更优秀的竞争性编程技能。在ARC-AGI上,o3的准确率是o1的三倍,表明其在处理新颖逻辑和技能获取任务方面的能力增强。

这些结果使o3成为人工智能领域领先的推理模型,应用于机器学习生成式AI等领域。该模型逐步推理的能力使其适合需要仔细斟酌的任务,尽管这会带来更高的计算成本和延迟。

与其他模型的比较

在AI模型的竞争格局中,o3常与其他组织的产品进行比较。AnthropicGoogle DeepMind开发了自己的推理模型,o3在SWE-bench Verified和Codeforces等基准上的表现被用来衡量其地位。2025年1月发布的o3-mini部分是对竞争压力的回应,包括来自DeepSeek R1等模型的压力,这导致了增强思维过程透明度的更新。

OpenAI在o3上的方法强调深思熟虑的推理,与优先考虑速度的模型形成对比。这种权衡反映在o3-mini中可用的不同推理努力级别上,允许用户在准确性和响应时间之间取得平衡。该模型集成到ChatGPT和API服务中,使其可供从免费用户到Pro订阅者的广泛用户访问。

部署与访问

o3变体的部署是分阶段的。o3-mini是首个广泛发布的,随后是o3和o4-mini,再后来是o3-pro。访问通过ChatGPT提供,不同级别提供不同的使用量。免费用户可获得中级推理努力的o3-mini,而付费订阅者可以访问更高级别和更频繁的使用。Pro订阅者可无限访问o3-mini和o3-mini-high。

o3模型的API访问随着时间的推移不断扩展,速率限制根据需求进行调整。2026年5月宣布的o3于2026年8月从ChatGPT退役表明该模型有计划的生命周期,尽管API访问不受影响。这一部署策略反映了OpenAI迭代改进和更新其模型产品的方法。

参见

参考文献

  • OpenAI公告和文档(2024-2026)
  • OpenAI报告的基准结果

外部链接

  • 介绍OpenAI o3和o4-mini
  • O3成本降低80%,并推出o3-pro
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·large-language-models·artificial-intelligence·reasoning-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史