Pourquoi la comparaison à l'aveugle bat les grilles d'évaluation : concevoir le critique sévère
Trois choix délibérés gardent un gauntlet honnête : un critique avec un contexte frais, un choix binaire au lieu d’un score, et une barre qui est une vraie chose au lieu de mots.

Pourquoi la comparaison à l'aveugle bat les grilles d'évaluation : concevoir le critique impitoyable
Chaque boucle d'auto-amélioration ratée échoue de la même manière : le modèle note son propre travail, la note s'enfle, la boucle déclare victoire trop tôt. La réponse de la boucle gauntlet est un critique conçu autour de trois choix délibérés. Si vous les réussissez, tout le reste n'est que détail.
Choix 1 : un agent différent, un contexte neuf
Le critique ne doit pas être le constructeur portant un autre chapeau. Il fonctionne avec un contexte neuf : il n'a jamais vu le plan du constructeur, ses excuses, ni combien de tours cela a pris. Il voit deux artefacts. Ce n'est pas une courtoisie ; les modèles sont systématiquement plus indulgents envers le travail qu'ils ont produit, et encore plus indulgents envers le travail dont ils savent qu'il a été difficile. Un contexte neuf supprime ce biais à la racine.
Choix 2 : un choix binaire, pas une note
Demandez une note sur 10 et vous obtenez 7 au premier tour, 8 au suivant, puis 9, indépendamment des progrès réels. Les notes sont relatives aux attentes, et les attentes bougent. Un choix binaire à l'aveugle ne peut pas dériver : le critique regarde le vôtre et la barre, étiquettes retirées, et dit lequel est meilleur. Un seul bit de sortie, impossible à flatter.
Choix 3 : la barre est une chose réelle, pas des mots
Une grille d'évaluation est un texte que l'agent peut interpréter ; l'interprétation penche toujours vers la réussite. Une barre est un artefact nommé et récupérable : le vrai Call of Duty, la vraie page concurrente, le vrai essai publié. Le critique n'interprète pas la qualité, il observe la défaite. Quand le travail gagne enfin le choix à l'aveugle, cela signifie quelque chose.
La dureté est fonctionnelle
« Rendez le critique vraiment impitoyable » ressemble à du style, mais c'est structurel : un critique neutre converge vers l'approbation parce que l'approbation termine la tâche. La dureté plus une sortie requise (nommez la plus grande lacune unique) transforme le critique en gradient : à chaque tour, le constructeur sait exactement quoi corriger et rien d'autre.
Lignée
C'est le modèle évaluateur-optimiseur du playbook building-effective-agents d'Anthropic, poussé à son extrême honnête - voir Du modèle évaluateur à la boucle gauntlet. Pour le voir en action : le prompt original, et les modes de défaillance quand l'un des trois choix est sauté.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read