Tree of Thoughts(ToT)は、大規模言語モデル(LLM)の問題解決能力を向上させるために設計されたプロンプティングおよび推論フレームワークです。これは、チェーン・オブ・ソート・プロンプティングの概念を拡張し、モデルが複数の異なる推論経路を同時に探索できるようにします。単一の線形的な思考の連鎖を生成する代わりに、ToTは中間思考のツリーを維持し、これらの分岐を体系的に評価し、検索アルゴリズムを使用して一貫した解決策へとナビゲートします。このアプローチは、計画、探索、戦略的先読みを必要とする複雑なタスクに特に効果的であり、単一の思考の連鎖が非最適な戦略に早期に固定化される可能性がある場合に有用です。
基本原則
このフレームワークは、多くの困難な問題において、推論は単純な経路ではなく、可能なステップの複雑な景観であるという原則に基づいて動作します。ToTはこれをツリー上の検索問題として構造化し、各ノードが中間思考または部分的な解決策を表します。主要な構成要素には、与えられた状態から候補となる思考を生成し、その有望性を評価し、これらの不完全なアイデアの空間を検索することが含まれます。独立した複数の完了をサンプリングして集約するのとは異なり、ToTはこの生成を明示的な評価と検索とインターリーブし、これまでに生成されたものの評価に基づいて次のステップに情報を提供します。
この方法論は、部分的には古典的な問題解決および計画技術に影響を受けています。これは、LLMの生成プロセスをパズルを解くような検索問題として再構成し、探索を導くためにヒューリスティックを使用します。これは、以前のArtificial intelligence時代に普及した深さ優先探索や最良優先探索などのアイデアの直接的な概念上の子孫です。
方法と構成要素
典型的なToTプロセスには、いくつかの具体的な段階が含まれます。最初は状態の定義であり、これは部分的な解決策、または以前の思考ステップから構成される十分な文脈です。次に、システムは思考生成器を定義する必要があり、これはモデルを使用して1つ以上の候補となる次のステップを作成します。多くのタスクでは、単一の提案(例えば、詩の次の行を生成する)で十分ですが、他のタスクでは、「提案」プロンプトがいくつかの異なる潜在的な次のステップを生成します。
次は状態評価器です。生成された各候補思考がスコアリングされます。評価は同じヒューリスティック(例えば、ルールのサブタイプ)またはサンプリングによるものにできます:LLM自体が、このステップが成功につながる確率を独立して評価します。この評価は定性的な値を生成します。
最終ステップは検索アルゴリズムです。最も一般的なアルゴリズムは、各レベルで最も有望なb個の状態が保持される幅優先探索(BFS)と、バックトラッキングの前に1つの分岐をその結論まで探索する深さ優先探索(DFS)です。この明示的な検索と先読み機能により、モデルは行き詰まりから回復することができ、これは創造的な文章作成など、いくつかのオープンなオプションが存在するタスクにとって重要なスキルです。
実装は標準的なトランスフォーマーアーキテクチャを使用します。これは、LLMがコンテキストウィンドウ内で自身が生成した代替案を解析および比較することを可能にするattention mechanismsを活用します。
アプリケーションとパフォーマンス
このフレームワークは、24ポイントゲームなどの探索を伴うタスクや、人間の評価者によって判断される創造的なストーリー作成などのタスクで、段階的な改善を示しています。数学や論理パズルでは、ToTは直接的なプロンプティングと比較して、典型的なlarge-language-modelsモデルの解決率を大幅に向上させることが示されています。検索と限定的な探索の組み合わせは、通常サンプル全体で平均化する他の推論方法(多数決投票など)と比較されます。ツリー構造の検索は、並列サンプリングの広さとチェーン・オブ・ソートの深さをうまく組み合わせています。
AI研究との関連
Tree of Thoughtsは、より意図的で計画能力のある自律エージェントを構築するためのより広範な研究トレンドの一部です。トークンごとの生成ではなく、推論を計画としてフレーム化します。これらの高レベルの制御および検索ループは、通常Machine learning方法論の一部ですが、Deep learningネットワークを活用します。研究者は、基盤モデルの改善がこの構造化された制御と連動すると期待しており、モデルが外部ツールやメモリを使用できるより広いエージェントループにアイデアを拡張しています。
この研究は、LLMプロンプティング技術の初期の進歩に大きく基づいており、適切なアプローチで明示的なトレーニングなしに推論能力を引き出すことができることを最初に示しました。そのため、その系統は、プロンプティングと創発的推論の研究におけるGoogle DeepMindおよびOpenAIでの作業から引き出されています。
評価と限界
ToTは能力を示していますが、より多くのトークン使用量とレイテンシというコストがかかります。思考と状態を決定するシステムはタスク固有であり、自動的に推論されるわけではなく、表面的なステップと計画の慎重なエンジニアリングが必要です。改善は、複雑さが不要な単純なタスクでは一貫性が低くなります。その程度は継続的な評価の対象ですが、出力に検索の計算を追加することの重要性を確認しています。
内部状態評価はタスク固有ですが、リソースと改善においてモデル自身の確率的スコアリングにキャストできます。それを使用するモデルはモジュールを生成できます。