译自英文

Tree of Thoughts是一种针对大型语言模型的推理框架,它以树状结构探索多个思维分支,从而在解决问题上优于线性的思维链提示。

思维树(ToT)是一种提示与推理框架,旨在增强大型语言模型(LLM)的问题解决能力。它扩展了思维链提示的概念,允许模型同时探索多条不同的推理路径。ToT 不是生成单一、线性的思维序列,而是维护一个中间思维的树状结构,系统地评估这些分支,并使用搜索算法导航以得出连贯的解决方案。这种方法对于需要规划、探索和战略性前瞻的复杂任务尤为有效,因为在这些任务中,单一的思维链可能会过早锁定在次优策略上。

核心原则

该框架基于这样一个原则:对于许多具有挑战性的问题,推理并非一条简单路径,而是一个由可能步骤组成的复杂景观。ToT 将此构建为对树状结构的搜索问题,其中每个节点代表一个中间思维或部分解决方案。关键组成部分包括从给定状态生成候选思维、评估其前景,以及在这些不完整想法的空间中进行搜索。与采样多个独立完成结果然后进行聚合不同,ToT 将这种生成与显式评估和搜索交织在一起,并根据对已产生内容的评估来指导下一步。

该方法在一定程度上受到经典问题解决和规划技术的影响。它将 LLM 的生成过程重新定义为类似于解谜的搜索问题,使用启发式方法来引导探索,这是早期人工智能时代流行的深度优先搜索或最佳优先搜索等思想的直接概念后裔。

方法与组成部分

典型的 ToT 过程涉及几个具体阶段。首先是定义状态,即部分解决方案,或由先前思维步骤组成的充分上下文。然后,系统必须定义一个思维生成器,它使用模型创建一个或多个候选的下一步。对于许多任务,单个提议(例如,生成一首诗的下一行)就足够了,而对于其他任务,“提议”提示会生成几个不同的潜在下一步。

接下来是状态评估器。每个生成的候选思维都会被评分。评估可以是相同的启发式方法(例如,规则子类型),也可以通过采样进行:LLM 本身独立评估该步骤导致成功的概率。此评估产生一个定性值。

最后一步是搜索算法。最常见的算法是广度优先搜索(BFS),其中每一层保留最有前景的 b 个状态,以及深度优先搜索(DFS),它先探索一个分支直到得出结论,然后再回溯。这种显式搜索和前瞻能力使模型能够从死胡同中恢复,这是创造性写作等存在多个开放选项的任务中的关键技能。

实现使用标准的 Transformer 架构。它利用了使 LLM 能够在上下文窗口中解析和比较自身生成的备选方案的注意力机制

应用与性能

该框架在涉及探索的任务(如 24 点游戏)以及由人类评估者评判的任务(如创意故事写作)上显示出阶跃式改进。在数学和逻辑谜题中,ToT 已被证明能显著提高典型大型语言模型模型相对于直接提示的解题率。搜索与有限探索的结合优于其他推理方法(如多数投票),后者通常是对样本进行平均。树状结构搜索成功地将并行采样的广度与思维链的深度结合起来。

与 AI 研究的联系

思维树是构建更具深思熟虑和规划能力的自主智能体的更广泛研究趋势的一部分。它不只是逐 token 生成,而是将推理视为规划。这些更高层次的控制和搜索循环通常是机器学习方法论的一部分,尽管它利用了深度学习网络。研究人员预计基础模型的改进将与这种结构化控制相互交织,并已将该思想扩展到更广泛的智能体循环中,其中模型可以使用外部工具或记忆。

该研究在很大程度上建立在 LLM 提示技术的早期进展之上,这些技术首先表明,通过正确的方法,无需显式训练即可引出推理能力。因此,其谱系源于Google DeepMindOpenAI在提示和涌现推理研究方面的工作。

评估与局限性

虽然 ToT 展示了能力,但代价是更多的 token 使用量和延迟。决定思维和状态的系统是任务特定的,不能自动推断,需要仔细设计表面步骤和计划。在简单任务上,改进不太一致,因为此时复杂性并非必要。其影响程度仍在持续评估中,但证实了在输出中添加搜索计算的重要性。

内部状态评估是任务特定的,但可以转化为模型自身的概率评分,以节省资源和改进。使用它的模型可以生成一个模块。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:reasoning-framework·large-language-models·prompt-engineering
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史