Blog›Guides

Do padrão de avaliador da Anthropic ao Gauntlet Loop

O padrão gauntlet loop é o esquema avaliador-optimizador com três endurecimentos: o mundo substituye o rubric, uma seleção cega substituye os scores, e vencer substituye os orçamentos de rodada.

Do padrão de avaliador da Anthropic ao Gauntlet Loop

Do Padrão de Avaliador da Anthropic ao Gauntlet Loop

O gauntlet loop não surgiu do nada. Seu esqueleto é o padrão avaliador-otimizador que a Anthropic descreve em seu guia de engenharia sobre como construir agentes eficazes: um componente gera, outro avalia com base em critérios, e o par itera. O que a versão de Matt Shumer adiciona é um conjunto de escolhas incisivas que transformam um padrão razoável em um confiável.

O padrão avaliador, versão didática

O gerador produz um rascunho. O avaliador pontua com base em critérios. Se estiver abaixo do limite, o feedback volta para o gerador. Repita. Isso funciona quando avaliar é genuinamente mais fácil do que gerar, o que é verdade para a maioria dos trabalhos criativos e visuais: reconhecer que uma página de destino supera a outra é muito mais fácil do que produzir a melhor.

Onde a versão didática falha

Três pontos, todos com o autojulgamento voltando sorrateiramente:

  • Critérios como palavras. Se o avaliador julga com base em uma rubrica escrita, o ecossistema do gerador consegue interpretar as palavras, e a interpretação tende a aprovar.
  • Pontuações. Notas numéricas sobem ao longo das rodadas porque estão ancoradas em expectativas, não na realidade.
  • Orçamentos de rodadas. "Itere 3 vezes" encerra o loop pelo relógio, não pela qualidade.
  • Os três endurecimentos do gauntlet

    O gauntlet loop corrige cada falha com algo externo:

  • Os critérios se tornam um artefato nomeado e buscável - o Call of Duty real, a página do concorrente real. O mundo substitui a rubrica.
  • As pontuações se tornam uma escolha binária cega - qual é melhor, com rótulos removidos. Um bit, sem desvios.
  • O orçamento se torna uma saída conquistada - o loop termina quando a escolha muda, ou quando um humano o interrompe.
  • Além de uma jogada organizacional que o livro didático deixa implícita: construtor e crítico são agentes separados com contextos separados, então o avaliador não pode herdar o apego do gerador ao próprio trabalho.

    Por que isso importa além de uma demonstração viral

    O padrão endurecido é geral: qualquer loop de gerar-avaliar que você execute (bots de revisão de código, pipelines de conteúdo, QA de agentes) fica mais honesto com os mesmos três ajustes. O gauntlet loop é a prova memorável de que eles funcionam em escala - 55.000 linhas de prova. Comece com O que é o Gauntlet Loop e depois escreva o seu próprio.

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents