思维链是一种提示技术,在这种技术中,语言模型被要求或被鼓励在给出最终答案之前生成一系列中间推理步骤,而不是直接跳到结论。该技术能提高模型在需要多步算术、逻辑或常识推理的任务上的准确性,并在2022年被正式描述后,成为提示工程领域最具影响力的思想之一。
起源
该术语最早出现在2022年1月谷歌的Jason Wei及其合著者发表的论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中。该论文表明,在提示中包含少量带有逐步推理步骤的示例(而不仅仅是最终答案),能显著提高模型在数学应用题和其他多步任务上的表现,这是一种通过提示本身实现的少样本学习形式。关键在于,该论文指出这种效果只出现在足够大的模型中,将思维链与涌现能力和扩展定律的讨论紧密联系在一起。
零样本思维链
2022年晚些时候,Takeshi Kojima及其合著者发表的另一篇论文发现,一种更简单的提示方式,即在问题后附加“让我们一步步思考”这一短语,而无需任何示例,就能在许多任务上带来类似的推理准确性提升。这一被称为零样本思维链的结果表明,这种效果并不严格需要少样本示例;只需指示模型在回答前进行推理,往往就足以释放更好的性能,这是模型在预训练中已具备的能力基础上展现出的零样本行为的一个实例。
机制与自洽性
研究人员对思维链为何有效提出了几种解释,包括:它为模型在确定答案前提供了更多的计算步骤;它让模型通过上下文学习将自己先前的推理作为额外上下文使用;以及它降低了错误在单次前向传播中无声累积的可能性。一种相关的技术称为自洽性,即为同一问题生成多条独立的推理链,并取其中出现频率最高的最终答案作为结果,以额外计算为代价进一步提高准确性。
从提示技术到训练行为
思维链最初是一种应用于未专门训练逐步推理的模型的提示策略,但它成为了一类新系统的基础。从2024年的OpenAI o1开始,研究实验室开始使用强化学习训练模型,使其在回答前生成长而有效的推理链,而不是依赖用户通过提示来请求这种行为。这一转变催生了推理模型这一类别,包括DeepSeek-R1,并将思维链从一种可选的提示技巧重新定义为一种训练出来的、通常是隐藏的内部过程,模型执行的推理量成为提高准确性的新杠杆,称为测试时计算,以增加推理时间为代价换取更高的准确性。