건틀릿 루프는 에이전틱 프롬프팅 패턴으로, AI 에이전트 시스템이 명시적인 품질 기준에 대해 작업을 반복적으로 개선하며, 빌더와 비평가 역할을 분리하고 맹검 비교를 사용하여 출력이 구체적인 기준을 능가할 때까지 반복하는 방식이다. 이 기법은 2026년 개발자 맷 슈머(Matt Shumer)가 대중화했으며, 그가 이름을 만들고 에이전틱 코딩 하네스 내에서 에이전트가 처음부터 끝까지 제작한 브라우저 게임 "클로드 오브 듀티(Claude of Duty)"를 구축하는 데 사용했다.
작동 방식
건틀릿 루프는 두 가지 입력에서 시작한다: 야심 찬 목표와 "훌륭함"이 무엇인지 보여주는 구체적인 예(기준)이다. 리드 에이전트는 다음을 수행한다:
- 기준 설정. 기준은 영감이 아니라 능가해야 할 표준으로 취급된다.
- 산출물 분해. 산출물을 독립적으로 개선하고 판단할 수 있는 가장 작은 부분으로 분해한다.
- 빌더 배정. 각 중요한 부분은 이를 생성하거나 수정하는 빌더 에이전트에 배정된다.
- 맹검 판단. 새로운 컨텍스트를 가진 별도의 비평가 에이전트가 현재 출력을 기준과 맹검 A/B 테스트로 비교하며, 어느 쪽이 어느 쪽인지 알지 못한다.
- 가장 큰 격차 찾기. 출력이 지면, 비평가는 가장 큰 의미 있는 차이를 지목하며, 이것이 다음 빌드 목표가 된다.
- 반복. 출력이 비교에서 이기거나 중단 조건에 도달할 때까지 반복한다.
빌더와 비평가의 분리는 중요하다: 새로운 컨텍스트의 판단자는 모델이 자신의 작업을 평가할 때 발생하는 자기 평가 편향을 피하고, 맹검 A/B 프레임은 일반적인 칭찬 대신 구체적인 비교를 강제한다.
요구 사항 및 용도
건틀릿 루프는 Claude Code 또는 Codex와 같은 에이전틱 하네스 내에서 실행되며, 여기서 에이전트는 파일을 열고, 코드를 실행하고, 결과를 렌더링하고, 스크린샷을 검사하고, 하위 에이전트를 생성할 수 있다. 이 패턴은 검사하고 개선할 수 있는 모든 산출물(코드, 웹사이트, 제품 디자인, 마케팅 자산, 글쓰기 및 연구)에 적용된다. 이는 멀티 에이전트 시스템에서 비평가-검증자 파이프라인 및 판정 패널과 함께 에이전틱 자기 개선 기법의 더 넓은 계열에 속한다.