测试时计算指的是模型在生成答案过程中所执行的计算量,与训练期间所花费的计算量相对。在深度学习时代的大部分时间里,能力提升几乎完全来自扩大训练规模:更多参数、更多数据、更多训练计算,正如扩展定律所描述的那样。测试时计算则将推理本身视为第二个杠杆。可以让模型思考更久、探索更多候选答案、或在返回响应前检查自身工作,而这些每一步都会在使用时增加额外计算,而非在训练时增加计算。
这种方法随着OpenAI o1的发布而进入主流应用,该模型由OpenAI于2024年9月发布与早期被调优为快速单次回答的聊天机器人不同,o1经过训练,在生成最终答案前会生成一段扩展的、大部分隐藏的内部推理链,并且随着允许的推理令牌增多,其在数学、编码和逻辑基准上的准确率可测量地提升这确立了推理模型作为大型语言模型的一个独特类别,包括DeepSeek-R1和谷歌Gemini“思考”变体在内的竞争对手在约一年内相继跟进
机制
测试时计算可以通过多种方式消耗最简单的做法是生成更长的思维链:模型在确定答案前,将中间推理步骤作为文本令牌写出,允许更多令牌通常能提升在具有明确正确答案的任务(如算术或代码正确性)上的表现第二类技术是采样多个独立答案并选择最佳者,要么通过多数投票(自一致性),要么通过使用独立的验证器或奖励模型对候选答案进行评分,有时组织为对部分解进行的树搜索第三类方法是修订:模型生成草稿、对其批评、再重新生成,花费额外轮次来捕捉错误,而非直接承诺第一个输出
这些方法与之前的上下文学习和提示技术的主要区别在于谁控制额外计算提示技术如少样本学习示例要求模型更有效地利用其现有权重;测试时计算方法,尤其是在使用可验证奖励进行强化学习训练的模型中,让模型自行决定给定问题需要多少内部思考,原则上在简单问题上花费少量计算,在困难问题上花费更多计算
经济学与权衡
由于推理模型每个答案消耗的令牌数可能比标准聊天模型多出许多倍,测试时计算重新引入了成本和延迟的权衡,而预训练规模此前大多将这种权衡推向了一边:实验室和用户现在可以在推理时通过支付更多思考成本来直接购买准确性这对产品设计有实际影响,,因为基于推理模型的编码代理或研究助手可能需要数十秒或数分钟来回答一个困难查询,,且这些模型的API定价通常既反映输出长度,也包含每令牌的溢价
反响与未解问题
研究人员一直在争论测试时计算与真正推理的关系,,而非仅仅是一种更昂贵的模式匹配形式,,且诸如ARC-AGI等基准上的结果被用于该争论的双方:推理模型相较早期几代模型大幅提高了分数,,但在需要训练数据中未充分呈现的推理模式的问题上,,性能仍会下降一些实验室将测试时计算扩展描述为一条与原始扩展定律重要性相当的新轴,,预期进一步收益将来自更高效的搜索和验证,,而非纯粹更长的思维链其他人指出,,额外推理计算的收益在超过某一点后呈现递减,,且该技术最好被理解为对预训练规模和微调的补充,,而非替代到2025年,,测试时计算也成为关于通用人工智能时间线的竞争性主张的核心,,因为通过“思考更久”带来的针对特定问题的准确性提升,,为实验室提供了一个新的、易于营销的能力调节手段,,区别于头条中的参数数量