Por que a Comparação às Cegas Supera as Rubricas: Projetando o Crítico Severo
Tres escolhas deliberadas mantêm um gauntlet honesto: um crítico com contexto novo, uma escolha binaria em vez de uma nota, e uma barra que é algo real em vez de palavras.

Por que a Comparação às Cegas Supera os Critérios: Projetando o Crítico Impiedoso
Todo loop de autoaperfeiçoamento que falha falha do mesmo jeito: o modelo avalia seu próprio trabalho, a nota se infla, o loop declara vitória cedo demais. A resposta do gauntlet loop é um crítico projetado em torno de três escolhas deliberadas. Se você acerta estas, todo o resto é detalhe.
Escolha 1: um agente diferente, contexto novo
O crítico não deve ser o construtor usando um chapéu diferente. Ele opera com contexto novo: nunca viu o plano do construtor, suas desculpas, ou quantas rodadas levou. Ele vê dois artefactos. Isso não é cortesia; os modelos são sistematicamente mais indulgentes com o trabalho que produjeron, e ainda mais indulgentes com o trabalho que sabem que foi difícil. O contexto novo elimina esse viés na raíz.
Escolha 2: uma escolha binária, não uma nota
Pida uma nota de 0 a 10 e você obtiene 7 na primeira rodada, 8 na seguinte, depois 9, independentemente do progresso real. As notas são relativas às expectativas, e as expectativas se movem. Uma escolha às cegas lado a lado não pode derivar: o crítico olha o seu trabalho e o padrão, com rótulos removidos, e diz qual é melhor. Um bit de saída, impossível de lisonjear.
Escolha 3: o padrão é algo real, não palavras
Um rubric é texto que o agente pode interpretar; a interpretação sempre se inclina para passar. Um padrão é um artefacto nomeado e recuperable: o Call of Duty real, a página do concorrente real, o ensayo publicado real. O crítico não interpreta qualidade, observa derrota. Quando o trabalho finalmente vence a comparación às cegas, isso significa algo.
A dureza é funcional
"Faça o crítico realmente duro" parece um detalhe de sabor, mas é essencial: um crítico neutro converge na aprobación porque a aprobación termina a tarefa. A dureza más uma única saída obrigatoria (nomee a maior lacuna) transforma o crítico em um gradiente: cada rodada, o construtor sabe exatamente o que corrigir e nada más.
Linaje
Este é o padrão evaluador-optimizador do playbook de construção de agentes eficaces de Anthropic, levado ao seu extremo honesto - veja Do Padrão Evaluador ao Gauntlet Loop. Para verlo em ação: o prompt original, e os modos de falha quando uma das três escolhas é omitida.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read