# 왜 블라인드 비교가 루브릭보다 나은가: 가혹한 비평가 설계하기
세 가지 신중한 선택이 건틀릿을 정직하게 유지합니다: 신선한 맥락을 가진 비평가, 점수 대신 이진 선택, 그리고 말이 아닌 실제 사물인 바.

왜 맹목 비교가 루브릭보다 나은가: 가혹한 비평가 설계하기
모든 실패한 자기 개선 루프는 같은 방식으로 실패한다: 모델이 자신의 작업을 스스로 평가하고, 점수가 부풀려지며, 루프가 일찍 승리를 선언한다. 건틀릿 루프의 답은 세 가지 신중한 선택을 중심으로 설계된 비평가다. 이것들을 제대로 맞추면 나머지는 모두 세부 사항이다.
선택 1: 다른 에이전트, 새로운 컨텍스트
비평가는 다른 모자를 쓴 빌더가 되어서는 안 된다. 그것은 새로운 컨텍스트로 실행된다: 빌더의 계획, 변명, 또는 몇 라운드가 걸렸는지를 본 적이 없다. 그것은 두 개의 산출물을 본다. 이것은 예의가 아니다; 모델은 자신이 만든 작업에 체계적으로 더 관대하며, 어려웠다고 아는 작업에는 더욱 관대하다. 새로운 컨텍스트는 그 편향을 뿌리에서 제거한다.
선택 2: 점수가 아닌 이진 선택
10점 만점에 점수를 요구하면 실제 진전과 무관하게 첫 라운드에 7, 다음에 8, 그 다음에 9를 받는다. 점수는 기대치에 상대적이며, 기대치는 움직인다. 맹목적인 나란히 비교는 표류할 수 없다: 비평가는 당신의 것과 기준선을 보고, 라벨을 제거한 채, 어느 것이 더 나은지 말한다. 한 비트의 출력, 아첨할 수 없다.
선택 3: 기준선은 말이 아닌 실제 사물
루브릭은 에이전트가 해석할 수 있는 텍스트다; 해석은 항상 통과 쪽으로 기울어진다. 기준선은 이름이 붙고 가져올 수 있는 산출물이다: 실제 Call of Duty, 실제 경쟁사 페이지, 실제 출판된 에세이. 비평가는 품질을 해석하지 않고, 패배를 관찰한다. 작업이 마침내 맹목 선택에서 이기면, 그것은 의미가 있다.
가혹함은 기능적이다
"비평가를 정말 가혹하게 만들어라"는 장식처럼 읽히지만, 그것은 하중을 지탱한다: 중립적인 비평가는 승인이 작업을 끝내기 때문에 승인으로 수렴한다. 가혹함과 하나의 필수 출력(가장 큰 격차 하나를 이름 붙이기)은 비평가를 기울기로 바꾼다: 매 라운드마다, 빌더는 정확히 무엇을 고칠지 알며 그 외에는 아무것도 모른다.
계보
이것은 Anthropic의 building-effective-agents 플레이북에서 나온 평가자-최적화 패턴을 정직한 극한으로 밀어붙인 것이다 - 평가자 패턴에서 건틀릿 루프로 참조. 실제 사례를 보려면: 원본 프롬프트, 그리고 세 가지 선택 중 하나를 건너뛸 때의 실패 모드를 참조하라.
Related Articles
- 최고의 Veo 2 프롬프트 (그리고 Veo 3로 옮기는 방법)
Sep 4, 2026 · 6 min read
- The Best Veo 2 Prompts (and How to Port Them to Veo 3)
Sep 4, 2026 · 6 min read
- Los Mejores Prompts de Veo 2 (y Cómo Portarlos a Veo 3)
Sep 4, 2026 · 6 min read
- As Melhores Prompts do Veo 2 (e Como Portá-los para o Veo 3)
Sep 4, 2026 · 6 min read
- Die besten Veo-2-Prompts (und wie man sie auf Veo 3 überträgt)
Sep 4, 2026 · 6 min read