Blog›Guides

Pourquoi la comparaison à l'aveugle bat les grilles d'évaluation : concevoir le critique sévère

Trois choix délibérés gardent un gauntlet honnête : un critique avec un contexte frais, un choix binaire au lieu d’un score, et une barre qui est une vraie chose au lieu de mots.

Pourquoi la comparaison à l'aveugle bat les grilles d'évaluation : concevoir le critique sévère

Pourquoi la comparaison à l'aveugle bat les grilles d'évaluation : concevoir le critique impitoyable

Chaque boucle d'auto-amélioration ratée échoue de la même manière : le modèle note son propre travail, la note s'enfle, la boucle déclare victoire trop tôt. La réponse de la boucle gauntlet est un critique conçu autour de trois choix délibérés. Si vous les réussissez, tout le reste n'est que détail.

Choix 1 : un agent différent, un contexte neuf

Le critique ne doit pas être le constructeur portant un autre chapeau. Il fonctionne avec un contexte neuf : il n'a jamais vu le plan du constructeur, ses excuses, ni combien de tours cela a pris. Il voit deux artefacts. Ce n'est pas une courtoisie ; les modèles sont systématiquement plus indulgents envers le travail qu'ils ont produit, et encore plus indulgents envers le travail dont ils savent qu'il a été difficile. Un contexte neuf supprime ce biais à la racine.

Choix 2 : un choix binaire, pas une note

Demandez une note sur 10 et vous obtenez 7 au premier tour, 8 au suivant, puis 9, indépendamment des progrès réels. Les notes sont relatives aux attentes, et les attentes bougent. Un choix binaire à l'aveugle ne peut pas dériver : le critique regarde le vôtre et la barre, étiquettes retirées, et dit lequel est meilleur. Un seul bit de sortie, impossible à flatter.

Choix 3 : la barre est une chose réelle, pas des mots

Une grille d'évaluation est un texte que l'agent peut interpréter ; l'interprétation penche toujours vers la réussite. Une barre est un artefact nommé et récupérable : le vrai Call of Duty, la vraie page concurrente, le vrai essai publié. Le critique n'interprète pas la qualité, il observe la défaite. Quand le travail gagne enfin le choix à l'aveugle, cela signifie quelque chose.

La dureté est fonctionnelle

« Rendez le critique vraiment impitoyable » ressemble à du style, mais c'est structurel : un critique neutre converge vers l'approbation parce que l'approbation termine la tâche. La dureté plus une sortie requise (nommez la plus grande lacune unique) transforme le critique en gradient : à chaque tour, le constructeur sait exactement quoi corriger et rien d'autre.

Lignée

C'est le modèle évaluateur-optimiseur du playbook building-effective-agents d'Anthropic, poussé à son extrême honnête - voir Du modèle évaluateur à la boucle gauntlet. Pour le voir en action : le prompt original, et les modes de défaillance quand l'un des trois choix est sauté.

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents