Warum Blindvergleiche besser sind als Rubriken: Den strengen Kritiker gestalten
Drei bewusste Entscheidungen halten einen Gauntlet ehrlich: ein Kritiker mit frischem Kontext, eine binäre Auswahl statt einer Bewertung und eine Messlatte, die eine echte Sache ist statt Worte.

Warum Blindvergleich besser ist als Bewertungsraster: Den strengen Kritiker entwerfen
Jede gescheiterte Selbstverbesserungsschleife scheitert auf dieselbe Weise: Das Modell benotet seine eigene Arbeit, die Note wird aufgebläht, die Schleife erklärt den Sieg zu früh. Die Antwort der Gauntlet Loop ist ein Kritiker, der um drei bewusste Entscheidungen herum entworfen ist. Wenn du diese richtig hinbekommst, ist alles andere nur Detail.
Entscheidung 1: ein anderes Agent, frischer Kontext
Der Kritiker darf nicht der Baumeister sein, der einen anderen Hut trägt. Er läuft mit frischem Kontext: Er hat nie den Plan des Baumeisters gesehen, dessen Ausreden oder wie viele Runden es gedauert hat. Er sieht zwei Artefakte. Das ist keine Höflichkeit; Modelle sind systematisch freundlicher zu Arbeit, die sie selbst erzeugt haben, und noch freundlicher zu Arbeit, von der sie wissen, dass sie schwer war. Frischer Kontext löscht diese Voreingenommenheit an der Wurzel.
2. Entscheidung: Eine binäre Auswahl, keine Punktzahl
Bitte um eine Punktzahl von 10 und du bekommst eine 7 in der ersten Runde, eine 8 in der nächsten, dann eine 9 - unabhängig vom echten Fortschritt. Punktzahlen sind relativ zu Erwartungen, und Erwartungen verschieben sich. Ein blinder Side-by-Side-Vergleich kann nicht driften: Der Kritiker schaut auf deine Arbeit und den Maßstab, mit entfernten Etiketten, und sagt, welche besser ist. Ein Bit an Ausgabe, unmöglich zu schmeicheln.
3. Entscheidung: Der Maßstab ist eine echte Sache, nicht Worte
Ein Bewertungsraster ist Text, den das Agent interpretieren darf; Interpretation neigt immer dazu, das Bestehen zu begünstigen. Ein Maßstab ist ein benanntes, abrufbares Artefakt: das echte Call of Duty, die echte Konkurrenzseite, der echte veröffentlichte Aufsatz. Der Kritiker interpretiert nicht Qualität, er beobachtet Niederlage. Wenn die Arbeit schließlich den Blindvergleich gewinnt, bedeutet das etwas.
Die Härte ist funktional
"Mach den Kritiker wirklich streng" klingt wie Geschmack, aber es ist tragend: Ein neutraler Kritiker konvergiert auf Zustimmung, weil Zustimmung die Aufgabe beendet. Härte plus eine erforderliche Ausgabe (benenne die größte einzelne Lücke) verwandelt den Kritiker in einen Gradienten: In jeder Runde weiß der Baumeister genau, was zu beheben ist, und nichts anderes.
Abstammung
Das ist das Evaluator-Optimizer-Muster aus dem Building-Effective-Agents-Playbook von Anthropic, bis zu seinem ehrlichen Extrem getrieben - siehe Vom Evaluator-Muster zur Gauntlet Loop. Um es in freier Wildbahn zu sehen: der ursprüngliche Prompt, und die Fehlermodi, wenn eine der drei Entscheidungen übersprungen wird.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read