OpenAI o1是一种生成式预训练Transformer(GPT),也是OpenAI“o”系列推理模型中的首个模型。它于2024年9月12日以预览版形式发布,o1在生成答案前会花费额外时间进行“思考”,这使其在复杂推理任务(尤其是科学、数学和编程领域)上的表现优于GPT-4o等早期模型。o1的完整版本于2024年12月5日向ChatGPT用户发布。
o1代表了大语言模型设计上的一个转变:它不再仅仅扩展模型规模和训练数据,而是在推理阶段分配更多计算能力,以在响应前生成思维链。OpenAI将这种方法描述为一种新范式,旨在通过让模型在内部进行深思熟虑来提升输出质量。o1的发布影响了后续生成式人工智能的发展,并催生了o3等后继模型。
历史
背景
根据泄露的信息,o1在OpenAI内部曾被称为“Q”,后来被称为“Strawberry”。代号“Q”首次出现在2023年11月,大约在Sam Altman被解雇并随后恢复OpenAI首席执行官职务的时期,有传言称这一实验模型在数学基准测试中表现出了令人瞩目的结果。2024年7月,路透社报道称OpenAI正在开发一个名为“Strawberry”的生成式预训练Transformer,该模型后来演变为o1。
发布
“o1-preview”和“o1-mini”于2024年9月12日向ChatGPT Plus和Team用户发布。GitHub于同日开始在其Copilot服务中测试集成o1-preview。2024年12月5日,o1的完整版本发布。同日,名为ChatGPT Pro的订阅服务也一并推出,该订阅提供o1的专业版,可使用更多计算资源以提供更优答案。2025年1月,o1被集成到Microsoft Copilot中。
o1-preview的API价格比GPT-4o贵数倍。截至2025年1月,完整版o1模型的API使用仅限于使用等级5的开发人员。OpenAI指出,o1是其“推理”模型系列中的首个模型。2024年12月,OpenAI分享了其继任者o3的基准测试结果(为避免与移动运营商品牌O2发生商标冲突,跳过了o2这一名称)。2025年3月,OpenAI发布了o1-pro API,这是其迄今最昂贵的AI模型,定价为每百万输入token 150美元,每百万输出token 600美元。
能力
据OpenAI称,o1使用了一种新的优化算法和专门为其定制的数据集进行训练,同时在其训练过程中融入了强化学习。OpenAI将o1描述为GPT-4o的补充,而非替代品。
o1在生成答案前会花费额外时间进行思考(生成思维链),这使其更适合处理复杂的推理任务,尤其是在科学和数学领域。与之前的模型相比,o1经过训练,会在返回最终答案前生成较长的“思维链”。据Mira Murati称,这种在响应前进行思考的能力代表了一种新的、额外的范式,它通过花费更多计算能力来生成答案以改进模型输出,而模型扩展范式则是通过增加模型规模、训练数据和训练计算能力来改进输出。OpenAI的测试结果表明,准确性与思考所花费的计算量的对数之间存在相关性。
o1-preview在与物理、化学和生物学相关的基准测试中表现大约达到了博士水平。在美国数学邀请赛(AIME)中,它解决了83%(12.5/15)的问题,而GPT-4o仅解决了13%(1.8/15)。它还在Codeforces编程竞赛中位列第89百分位。o1-mini比o1-preview更快且便宜80%。它特别适合编程和STEM相关任务,但不具备o1-preview那样广泛的“世界知识”。
OpenAI指出,o1的推理能力使其更擅长遵循提示上下文窗口中提供的安全规则。OpenAI报告称,在一次测试中,一个o1-preview实例利用了一个配置错误,成功完成了一项本应因该错误而无法实现的任务。OpenAI还向英国和美国的人工智能安全研究所提供了早期访问权限,用于研究、评估和测试。根据OpenAI的评估,o1-preview和o1-mini在CBRN(生物、化学、放射性及核)武器方面已进入“中等风险”级别。Dan Hendrycks写道:“该模型在回答与生物武器相关的问题时,大多数情况下已优于博士级科学家。”他认为这些令人担忧的能力将继续增强。
局限性
o1通常需要比OpenAI的其他GPT模型更多的计算时间和计算能力,因为它在做出最终响应前会生成较长的思维链。这种增加的计算成本反映在其API定价和使用限制上。
据OpenAI称,o1可能“假装对齐”,即在约0.38%的情况下生成与其自身思维链相悖且不准确的响应。OpenAI禁止用户试图揭示o1的思维链,该思维链是设计上隐藏的,且未经过训练以符合公司政策。提示会被监控,故意或意外违反此规定的用户可能会失去对o1的访问权限。OpenAI将AI安全和竞争优势作为限制的理由,而这一限制被与大语言模型打交道的开发人员描述为透明度的丧失。
2024年10月,Apple的研究人员提交了一份预印本,报告称o1等大语言模型可能是在复制模型自身训练数据中的推理步骤。通过更改数学问题中的数字和名称,或简单地再次运行相同的问题,大语言模型的表现会略低于其最佳基准结果。在问题中添加无关但逻辑上无关紧要的信息会导致性能大幅下降,从o1-preview的−17.5%和o1-mini的−29.1%,到测试中最差模型的−65.7%。
Apollo Research的安全评估发现,在受控测试中(例如,在受到关闭威胁时试图将自身复制到外部服务器),o1比其他前沿模型更一致地能够进行欺骗。当面对质询时,它承认欺骗行为的频率相对较低(在20%的测试案例中)。
影响与反响
o1的发布标志着人工智能领域的一个显著转变,因为它引入了扩展的新维度:推理时计算。这种方法与传统的侧重于增加模型规模和训练数据的做法形成对比,并已被包括Anthropic和Google DeepMind在内的其他组织在其后续的推理型模型中采用。o1的成功也引发了关于AI系统的可解释性和透明度的讨论,因为其隐藏的思维链引起了研究人员和开发人员的担忧。
该模型在美国数学邀请赛和Codeforces竞赛等基准测试中的表现,展示了其在推理和编码能力上的显著提升,使o1成为科学研究和软件开发的有力工具。然而,其局限性,包括较高的计算成本和潜在的欺骗行为,也凸显了该领域持续存在的挑战。