Blog›Guides

5 Formas en que un Gauntlet Loop se Rompe (Y Cómo Arreglar Cada Una)

Barras vagas, constructores que se autoevalúan, críticos suaves, rondas fijas y piezas demasiado grandes para juzgar: los cinco fallos predecibles y sus soluciones.

5 Formas en que un Gauntlet Loop se Rompe (Y Cómo Arreglar Cada Una)

5 Formas en que un Gauntlet Loop Falla (Y Cómo Arreglar Cada Una)

El gauntlet loop parece robusto desde afuera: constructores, críticos, una barra, iteración. En la práctica, la mayoría de los primeros intentos fallan, y fallan de maneras predecibles. Aquí están los cinco modos de falla que vemos, del peor al primero.

1. La barra vaga

El asesino más común. Si la barra es "diseño premiado" o "escritura de clase mundial", el crítico no tiene nada que buscar, así que inventa una comparación y aprueba todo. El loop gira felizmente y produce mediocridad con confianza. Arreglo: la barra debe ser nombrada (una página específica, publicación, repositorio), obtenible (el crítico puede abrirla o capturarla) y comparable (ambos artefactos pueden estar lado a lado). Si no puedes pegar una URL a tu barra, aún no tienes una.

2. El constructor que se califica a sí mismo

Si el mismo contexto de agente construye y juzga, el juicio hereda cada sesgo: esfuerzo, apego, fatiga. Arreglo: el crítico es un sub-agente separado con contexto fresco. Ve dos artefactos y nada más - no el plan, no el número de rondas, no las excusas.

3. El crítico suave

Un crítico al que se le pregunta "¿qué tan bueno es esto, del 1 al 10?" da 7, luego 8, luego 9. Las puntuaciones se desvían porque se juzgan contra expectativas, y las expectativas se mueven. Arreglo: dale al crítico una tarea binaria. ¿Cuál es mejor, A o B, con etiquetas eliminadas? Y exige que nombre la brecha más grande cuando la barra gana - esa brecha es la instrucción completa de la siguiente ronda.

4. El número fijo de rondas

"Mejóralo 5 veces" se detiene exactamente cuando el modelo siente ganas de relajarse, ya sea que el trabajo sea excelente o basura. Arreglo: la salida es ganar la comparación a ciegas, o que un humano lo decida. Nada más termina el loop.

5. Piezas demasiado grandes para juzgar

Un crítico puede comparar una sección hero, un modelo de arma, un gráfico. No puede comparar honestamente "toda la aplicación" de una sola mirada, así que redondea hacia arriba. Arreglo: divide el objetivo en artefactos lo suficientemente pequeños para que una elección a ciegas sea significativa, y somete cada pieza al gauntlet.

El patrón detrás de los arreglos

Cada falla es la misma falla: en algún lugar, la autoevaluación se filtró de vuelta. El template codifica los cinco arreglos; el original anotado los muestra en las propias palabras de Shumer.

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents