Blog›Guides

Del patrón de evaluador de Anthropic al bucle Gauntlet

O loop gauntlet é o padrão avaliador-otimizador com três endurecimentos: o mundo substitui a rubrica, uma escolha cega substitui as pontuações, vencer substitui os orçamentos de rodada.

Del patrón de evaluador de Anthropic al bucle Gauntlet

Del patrón de evaluador de Anthropic al Gauntlet Loop

El gauntlet loop no apareció de la nada. Su esqueleto es el patrón evaluador-optimizador que Anthropic describe en su guía de ingeniería sobre cómo construir agentes efectivos: un componente genera, otro evalúa contra criterios, y el par itera. Lo que la versión de Matt Shumer añade es un conjunto de elecciones de bordes duros que convierten un patrón razonable en uno confiable.

El patrón de evaluador, versión de libro de texto

El generador produce un borrador. El evaluador lo puntúa contra criterios. Si está por debajo del umbral, la retroalimentación vuelve al generador. Repetir. Funciona cuando la evaluación es genuinamente más fácil que la generación, lo cual es cierto para la mayoría del trabajo creativo y visual: reconocer que una página de aterrizaje supera a otra es mucho más fácil que producir la mejor.

Donde la versión de libro de texto pierde

Tres lugares, todos con el auto-juicio colándose de nuevo:

  • Criterios como palabras. Si el evaluador juzga contra una rúbrica escrita, el ecosistema del generador puede interpretar las palabras, y la interpretación se inclina hacia aprobar.
  • Puntuaciones. Las calificaciones numéricas suben a lo largo de las rondas porque están ancladas a expectativas, no al mundo.
  • Presupuestos de rondas. "Iterar 3 veces" termina el bucle por reloj, no por calidad.
  • Los tres endurecimientos del gauntlet

    El gauntlet loop parchea cada fuga con algo externo:

  • Los criterios se convierten en un artefacto nombrado y recuperable - el Call of Duty real, la página de competidor real. El mundo reemplaza la rúbrica.
  • Las puntuaciones se convierten en una elección binaria a ciegas - cuál es mejor, con etiquetas eliminadas. Un bit, sin deriva.
  • El presupuesto se convierte en una salida ganada - el bucle termina cuando la elección se invierte, o cuando un humano lo detiene.
  • Más un movimiento organizativo que el libro de texto deja implícito: el constructor y el crítico son agentes separados con contextos separados, así el evaluador no puede heredar el apego del generador a su propio trabajo.

    Por qué esto importa más allá de una demo viral

    El patrón endurecido es general: cualquier bucle de generar-evaluar que ejecutes (bots de revisión de código, pipelines de contenido, QA de agentes) se vuelve más honesto con los mismos tres parches. El gauntlet loop es la prueba memorable de que funcionan a escala - 55,000 líneas de prueba. Empieza con Qué es el Gauntlet Loop, luego escribe el tuyo propio.

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents