BlogGuides

# 앤트로픽의 평가자 패턴에서 건틀릿 루프까지

건틀릿 루프는 평가자-최적화 패턴에 세 가지 강화를 적용한 것입니다: 세계가 루브릭을 대체하고, 블라인드 픽이 점수를 대체하며, 승리가 라운드 예산을 대체합니다.

# 앤트로픽의 평가자 패턴에서 건틀릿 루프까지

Anthropic의 평가자 패턴에서 건틀릿 루프까지

건틀릿 루프는 갑자기 나타난 것이 아니다. 그 뼈대는 Anthropic이 효과적인 에이전트 구축에 관한 엔지니어링 가이드에서 설명하는 평가자-최적화자 패턴이다: 한 구성 요소가 생성하고, 다른 구성 요소가 기준에 대해 평가하며, 이 쌍이 반복한다. Matt Shumer의 버전이 추가한 것은 합리적인 패턴을 신뢰할 수 있는 패턴으로 바꾸는 일련의 날카로운 선택들이다.

평가자 패턴, 교과서 버전

생성기가 초안을 만든다. 평가기가 기준에 대해 점수를 매긴다. 임계값 미만이면 피드백이 생성기로 돌아간다. 반복한다. 이는 평가가 생성보다 진정으로 쉬울 때 작동하며, 이는 대부분의 창의적 및 시각적 작업에 해당한다: 한 랜딩 페이지가 다른 것보다 낫다는 것을 인식하는 것은 더 나은 것을 만드는 것보다 훨씬 쉽다.

교과서 버전이 새는 곳

세 곳이 있으며, 모두 자기 판단이 다시 스며드는 곳이다:

  • 기준으로서의 단어. 평가기가 작성된 루브릭에 대해 판단하면, 생성기의 생태계가 그 단어를 해석할 수 있고, 해석은 통과 쪽으로 기울어진다.
  • 점수. 숫자 등급은 기대치에 고정되어 있기 때문에 라운드가 진행될수록 위로 표류한다 - 세계가 아닌 기대치에.
  • 라운드 예산. "3회 반복"은 품질이 아닌 시계에 의해 루프를 종료한다.
  • 건틀릿의 세 가지 강화

    건틀릿 루프는 각 누수를 외부적인 것으로 패치한다:

  • 기준은 명명된, 가져올 수 있는 산출물이 된다 - 실제 Call of Duty, 실제 경쟁자 페이지. 세계가 루브릭을 대체한다.
  • 점수는 맹검 이진 선택이 된다 - 어느 것이 더 나은지, 라벨이 제거된 상태. 한 비트, 표류 없음.
  • 예산은 획득한 퇴장이 된다 - 선택이 뒤집힐 때, 또는 인간이 멈출 때 루프가 종료된다.
  • 게다가 교과서가 암시적으로 남겨둔 한 가지 조직적 움직임: 빌더와 비평가는 별도의 컨텍스트를 가진 별도의 에이전트이므로, 평가자는 생성자가 자신의 작업에 대한 애착을 물려받을 수 없다.

    이것이 하나의 바이럴 데모를 넘어 중요한 이유

    강화된 패턴은 일반적이다: 실행하는 모든 생성-평가 루프(코드 리뷰 봇, 콘텐츠 파이프라인, 에이전트 QA)는 동일한 세 가지 패치로 더 정직해진다. 건틀릿 루프는 그것들이 규모에서 작동한다는 기억에 남는 증거이다 - 55,000줄의 증거. 건틀릿 루프란 무엇인가로 시작한 다음, 자신만의 것을 작성하라.

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents