사고의 나무

영어에서 번역됨

Tree of Thoughts는 대규모 언어 모델을 위한 추론 프레임워크로, 트리 구조에서 여러 사고 분기를 탐색하여 선형적인 chain-of-thought 프롬프팅보다 문제 해결 능력을 향상시킵니다.

Tree of Thoughts(ToT)는 대규모 언어 모델(LLM)의 문제 해결 능력을 향상시키기 위해 설계된 프롬프팅 및 추론 프레임워크이다. 이는 모델이 여러 개의 서로 다른 추론 경로를 동시에 탐색할 수 있도록 함으로써 chain-of-thought 프롬프팅의 개념을 확장한다. 단일하고 선형적인 사고의 시퀀스를 생성하는 대신, ToT는 중간 사고의 트리를 유지하고, 이러한 분기를 체계적으로 평가하며, 검색 알고리즘을 사용하여 일관된 해결책을 향해 탐색한다. 이 접근 방식은 단일 사고 흐름이 조기에 차선의 전략에 고착될 수 있는 계획, 탐색 및 전략적 예측이 필요한 복잡한 작업에 특히 효과적이다.

핵심 원칙

이 프레임워크는 많은 어려운 문제에 대해 추론이 단순한 경로가 아니라 가능한 단계의 복잡한 지형이라는 원칙에 따라 작동한다. ToT는 이를 트리에 대한 검색 문제로 구조화하며, 각 노드는 중간 사고 또는 부분 해결책을 나타낸다. 핵심 구성 요소는 주어진 상태에서 후보 사고를 생성하고, 그 가능성을 평가하며, 이러한 불완전한 아이디어의 공간을 검색하는 것을 포함한다. 여러 개의 독립적인 완성을 샘플링한 다음 집계하는 것과 달리, ToT는 명시적인 평가와 검색을 생성과 인터리브하여 지금까지 생성된 것에 대한 평가로 다음 단계를 알린다.

이 방법론은 부분적으로 고전적인 문제 해결 및 계획 기술의 영향을 받는다. 이는 LLM의 생성 과정을 퍼즐을 푸는 것과 유사한 검색 문제로 재구성하며, 휴리스틱을 사용하여 탐색을 안내한다. 이는 Artificial intelligence의 초기 시대에 대중화된 Depth-First Search 또는 Best-First Search와 같은 아이디어의 직접적인 개념적 후손이다.

방법 및 구성 요소

일반적인 ToT 프로세스는 몇 가지 구체적인 단계를 포함한다. 첫 번째는 이전 사고 단계로 구성된 부분 해결책 또는 충분한 컨텍스트인 상태의 정의이다. 그런 다음 시스템은 모델을 사용하여 하나 이상의 후보 다음 단계를 생성하는 사고 생성기를 정의해야 한다. 많은 작업에서 단일 제안(예: 시의 다음 줄 생성)으로 충분하지만, 다른 작업에서는 "제안" 프롬프트가 여러 개의 서로 다른 잠재적 다음 단계를 생성한다.

다음은 상태 평가자이다. 생성된 각 후보 사고는 점수가 매겨진다. 평가는 동일한 휴리스틱(예: 규칙 하위 유형)이거나 샘플링에 의한 것일 수 있다. 즉, LLM 자체가 이 단계가 성공으로 이어질 확률을 독립적으로 평가한다. 이 평가는 질적 가치를 생성한다.

마지막 단계는 검색 알고리즘이다. 가장 일반적인 알고리즘은 각 수준에서 가장 유망한 b 상태를 유지하는 Breath-First Search(BFS)와 백트래킹 전에 한 분기를 끝까지 탐색하는 Depth-First Search(DFS)이다. 이러한 명시적 검색과 예측 능력은 모델이 막다른 길에서 회복할 수 있게 하며, 이는 여러 개의 열린 옵션이 존재하는 창의적 쓰기와 같은 작업에 중요한 기술이다.

구현은 표준 트랜스포머 아키텍처를 사용한다. 이는 LLM이 컨텍스트 창에서 자체 생성된 대안을 구문 분석하고 비교할 수 있게 하는 attention mechanisms을 활용한다.

응용 및 성능

이 프레임워크는 24점 게임과 같은 탐색을 포함하는 작업과 창의적 스토리 쓰기와 같은 인간 평가자 판단 작업에서 단계적 개선을 보여주었다. 수학 및 논리 퍼즐에서 ToT는 직접 프롬프팅에 비해 일반적인 large-language-models 모델의 해결률을 크게 높이는 것으로 나타났다. 검색과 제한된 탐색의 결합은 일반적으로 샘플에 대해 평균을 내는 다른 추론 방법(예: 다수결 투표)과 비교된다. 트리 구조 검색은 병렬 샘플링의 폭과 chain-of-thought의 깊이를 성공적으로 결합한다.

AI 연구와의 연결

Tree of Thoughts는 더 신중하고 계획 가능한 자율 에이전트를 구축하려는 더 넓은 연구 추세의 일부이다. 토큰별 생성에 그치는 것이 아니라 추론을 계획으로 구성한다. 이러한 상위 수준 제어 및 검색 루프는 일반적으로 Machine learning 방법론의 일부이지만 Deep learning 네트워크를 활용한다. 연구자들은 기초 모델의 개선이 이러한 구조화된 제어와 연동될 것으로 기대하며, 모델이 외부 도구나 메모리를 사용할 수 있는 더 넓은 에이전트 루프로 아이디어를 확장했다.

이 연구는 올바른 접근 방식으로 추론 능력을 이끌어내기 위해 명시적 훈련을 할 수 있음을 처음으로 보여준 초기 LLM 프롬프팅 기술의 발전에 크게 의존한다. 따라서 그 계보는 Google DeepMindOpenAI에서의 프롬프팅 및 창발적 추론 연구에서 비롯된다.

평가 및 한계

ToT는 능력을 입증하지만 더 많은 토큰 사용과 지연 시간이라는 비용이 든다. 사고와 상태를 결정하는 시스템은 작업별로 다르며 자동으로 추론되지 않으므로 피상적 단계와 계획의 신중한 엔지니어링이 필요하다. 개선은 복잡성이 필요하지 않은 단순한 작업에서는 덜 일관적이다. 그 정도는 지속적인 평가의 대상이지만 출력에 검색의 계산적 추가의 중요성을 확인한다.

작업별 내부 상태 평가는 특정하지만 모델 자체의 확률적 점수에 자원 및 개선으로 캐스팅될 수 있다. 이를 사용하는 모델은 모듈을 생성할 수 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:reasoning-framework·large-language-models·prompt-engineering
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사