Blog›Guides

Warum Blindvergleiche besser sind als Rubriken: Den strengen Kritiker gestalten

Drei bewusste Entscheidungen halten einen Gauntlet ehrlich: ein Kritiker mit frischem Kontext, eine binäre Auswahl statt einer Bewertung und eine Messlatte, die eine echte Sache ist statt Worte.

Warum Blindvergleiche besser sind als Rubriken: Den strengen Kritiker gestalten

Warum Blindvergleich besser ist als Bewertungsraster: Den strengen Kritiker entwerfen

Jede gescheiterte Selbstverbesserungsschleife scheitert auf dieselbe Weise: Das Modell benotet seine eigene Arbeit, die Note wird aufgebläht, die Schleife erklärt den Sieg zu früh. Die Antwort der Gauntlet Loop ist ein Kritiker, der um drei bewusste Entscheidungen herum entworfen ist. Wenn du diese richtig hinbekommst, ist alles andere nur Detail.

Entscheidung 1: ein anderes Agent, frischer Kontext

Der Kritiker darf nicht der Baumeister sein, der einen anderen Hut trägt. Er läuft mit frischem Kontext: Er hat nie den Plan des Baumeisters gesehen, dessen Ausreden oder wie viele Runden es gedauert hat. Er sieht zwei Artefakte. Das ist keine Höflichkeit; Modelle sind systematisch freundlicher zu Arbeit, die sie selbst erzeugt haben, und noch freundlicher zu Arbeit, von der sie wissen, dass sie schwer war. Frischer Kontext löscht diese Voreingenommenheit an der Wurzel.

2. Entscheidung: Eine binäre Auswahl, keine Punktzahl

Bitte um eine Punktzahl von 10 und du bekommst eine 7 in der ersten Runde, eine 8 in der nächsten, dann eine 9 - unabhängig vom echten Fortschritt. Punktzahlen sind relativ zu Erwartungen, und Erwartungen verschieben sich. Ein blinder Side-by-Side-Vergleich kann nicht driften: Der Kritiker schaut auf deine Arbeit und den Maßstab, mit entfernten Etiketten, und sagt, welche besser ist. Ein Bit an Ausgabe, unmöglich zu schmeicheln.

3. Entscheidung: Der Maßstab ist eine echte Sache, nicht Worte

Ein Bewertungsraster ist Text, den das Agent interpretieren darf; Interpretation neigt immer dazu, das Bestehen zu begünstigen. Ein Maßstab ist ein benanntes, abrufbares Artefakt: das echte Call of Duty, die echte Konkurrenzseite, der echte veröffentlichte Aufsatz. Der Kritiker interpretiert nicht Qualität, er beobachtet Niederlage. Wenn die Arbeit schließlich den Blindvergleich gewinnt, bedeutet das etwas.

Die Härte ist funktional

"Mach den Kritiker wirklich streng" klingt wie Geschmack, aber es ist tragend: Ein neutraler Kritiker konvergiert auf Zustimmung, weil Zustimmung die Aufgabe beendet. Härte plus eine erforderliche Ausgabe (benenne die größte einzelne Lücke) verwandelt den Kritiker in einen Gradienten: In jeder Runde weiß der Baumeister genau, was zu beheben ist, und nichts anderes.

Abstammung

Das ist das Evaluator-Optimizer-Muster aus dem Building-Effective-Agents-Playbook von Anthropic, bis zu seinem ehrlichen Extrem getrieben - siehe Vom Evaluator-Muster zur Gauntlet Loop. Um es in freier Wildbahn zu sehen: der ursprüngliche Prompt, und die Fehlermodi, wenn eine der drei Entscheidungen übersprungen wird.

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents