OpenAI o3-mini 发布

译自英文

OpenAI于2025年1月31日发布了o3-mini,作为面向开发者的一款更小、更具成本效益的推理模型,在技术领域提供了改进的性能,并支持可调的推理努力级别。

OpenAI o3-mini是由OpenAI开发的大语言模型,于2025年1月31日发布。它是OpenAI o3模型的较小变体,旨在为开发者和用户提供一种经济高效的替代方案,使其能够以较低的计算需求获得更大模型的推理能力。o3-mini基于生成式人工智能Transformer架构构建,利用深度学习技术进行逐步逻辑推理。

该模型属于o3系列,该系列接替了OpenAI o1模型。o3-mini的推出旨在平衡性能与成本,面向编码、数学和科学等技术领域,这些领域对精度和速度至关重要。它提供低、中、高三种推理努力级别,允许用户根据需求在响应延迟和质量之间进行权衡。

历史与发布

OpenAI o3模型于2024年12月20日首次公布。选择“o3”而非“o2”这一名称是为了避免与移动运营商品牌O2产生商标冲突。OpenAI邀请安全与安保研究人员在2025年1月10日前申请该模型的早期访问权限。公布后,计划推出两个变体:o3和o3-mini。

2025年1月31日,OpenAI向所有ChatGPT用户(包括免费用户)以及部分API用户发布了o3-mini。OpenAI将o3-mini描述为o1在需要精度和速度的技术领域的“专业替代方案”。ChatGPT免费版本使用中等推理努力级别,而付费订阅者可以访问o3-mini-high,这是一个使用更多计算的变体。ChatGPT Pro层级的订阅者则获得o3-mini和o3-mini-high的无限访问权限。

不久后,即2月2日,OpenAI推出了OpenAI Deep Research,这是一项使用o3版本来基于网络搜索在5至30分钟内生成综合报告的服务。2月6日,为应对DeepSeek R1等竞争对手的压力,OpenAI宣布更新以增强o3-mini思维过程的透明度。2月12日,OpenAI提高了ChatGPT Plus订阅者使用o3-mini-high的速率限制,从每周50次请求提升至每天50次,并增加了文件和图像上传支持。

2025年4月16日,OpenAI发布了o3和o4-mini,后者是o3-mini的继任者。随后,在6月10日,OpenAI发布了o3-pro,该公司声称这是其迄今最强大的模型。在一份声明中,OpenAI建议在可靠性比速度更重要的棘手问题上使用o3-pro,并指出等待几分钟是值得的权衡。2026年5月28日,OpenAI宣布o3将于2026年8月26日从ChatGPT中退役,经过90天的日落期,但此变更不影响API。

能力与性能

OpenAI使用强化学习训练o3-mini在生成答案前进行“思考”,这种方法被称为“私有思维链”。该方式使模型能够提前规划并通过任务进行推理,执行中间推理步骤来解决问题,但代价是额外的计算能力和更高的响应延迟。

o3-mini在复杂任务(包括编码、数学和科学)上的表现显著优于o1。根据OpenAI的数据,完整的o3模型在GPQA Diamond基准上取得了87.7%的分数,该基准包含未公开在线发布的专家级科学问题。在软件工程基准SWE-bench Verified上,o3得分为71.7%,而o1为48.9%。在Codeforces上,o3达到了2727的Elo分数,而o1为1891。在通用人工智能抽象与推理语料库(ARC-AGI)基准上,o3的准确率是o1的三倍。

这些基准凸显了该模型的高级推理能力,使其适用于需要逻辑演绎和多步骤问题解决的任务。o3-mini的推出通过降低运营成本将这些能力扩展到了更广泛的受众。

技术设计与架构

与其前身一样,o3-mini是一种基于神经网络的模型,采用Transformer架构。它结合了多头注意力机制和位置编码来有效处理输入序列。该模型使用课程学习RLHF(基于人类反馈的强化学习)进行训练,这有助于使其输出与人类期望保持一致。

o3-mini的关键特性之一是其可调节的推理努力级别,这些级别控制思维链过程的深度。此功能允许开发者根据应用优化速度或准确性。该模型还支持迭代细化,使用户能够引导其得出更精确的答案。

定价与可用性

OpenAI将o3-mini定位为面向开发者的经济高效解决方案。该公司指出,它比完整的o3模型便宜得多,在某些配置下价格低80%。这一定价策略旨在使高级推理能力能够应用于更广泛的场景,从Amazon Web ServicesAzure云部署到移动应用。

o3-mini可通过OpenAI API和ChatGPT界面使用。截至其初始发布时,免费层级用户可有限使用,而付费订阅者享有上述更高的速率限制。

比较与影响

人工智能的竞争格局中,o3-mini面临Anthropic的Claude和Google DeepMind模型等竞争对手。o3-mini的发布是OpenAI对DeepSeek R1等成本竞争性模型出现的回应的一部分,这些模型迫使该公司提供更实惠的推理选项。该模型在ARC-AGI和Codeforces等基准上的表现证明了其处理复杂推理任务的能力,使其成为机器学习研究者和开发者的宝贵工具。

o3-mini的推出影响了更广泛的AI生态系统,鼓励其他公司关注效率和可负担性。它还引发了关于推理过程透明度的讨论,促使OpenAI更新了其传达模型思维模式的方式。

参见

  • OpenAI o1(作为前身,尽管不在slug列表中,我们使用类似OpenAI的相关链接)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·large-language-model·artificial-intelligence·reasoning-model
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史