译自英文

OpenAI于2024年发布的一款注重推理能力的大型语言模型,是首个在推理阶段采用扩展且隐藏的思维链推理后再生成答案的广泛部署模型。

OpenAI o1是由OpenAI开发的推理模型,于2024年9月以预览形式发布,并于2024年12月全面推出。它代表了与先前GPT-4系列的重大转变,引入了一种专门针对多步推理任务(如竞赛数学、编程和科学问题解决)进行优化的训练和推理方法,而非仅追求进一步扩大通用规模。

扩展思维链

o1的核心技术创新,正如OpenAI所描述的,是训练模型在生成最终答案之前生成扩展的内部思维链,并使用强化学习来改进这一中间推理过程的质量。与早期通过用户提供的指令来引导思维链推理的提示技术不同,o1经过训练可自动执行这种推理,并将更多计算分配给更困难的问题,这种方法后来被称为测试时计算扩展:不仅通过增加模型或训练数据规模,还可以通过在推理时让模型“思考”更久来提升能力。OpenAI刻意向用户隐藏了模型的原始内部推理轨迹,仅显示摘要版本,理由是担心该技术被复制的竞争问题,以及原始思维链可能包含未过滤或操纵性内容的安全问题。

性能与基准测试

OpenAI报告称,o1在推理密集型评估中相比GPT-4类模型取得了显著提升,包括在竞赛数学问题和SWE-bench软件工程基准上的大幅改进,以及在博士级科学问题上的强劲表现。该模型的提升在需要扩展、可验证的多步逻辑任务上最为明显,而在更开放或知识回忆类任务上的改进相对有限,这一模式强化了该领域对原始知识容量与推理能力之间日益增长的区分。

行业影响

o1的发布促使整个行业迅速响应,包括DeepSeek在内的竞争实验室也发布了各自的推理专注模型,最著名的是2025年1月发布的DeepSeek-R1,该模型以显著更低的报告训练成本实现了可比的推理基准性能,并且与o1不同,它公开了完整的思维链推理轨迹和开放权重。这种对比加剧了关于OpenAI隐藏推理轨迹决定的价值争论,并推动了关于前沿AI中开放权重竞争的更广泛讨论。o1将测试时计算扩展确立为与预训练规模并列的独特且持久的范式,OpenAI及竞争对手随后发布了基于相同底层方法的进一步推理模型迭代。

分类:generative-ai·reasoning·openai
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史