Blog›Guides

Vom Evaluator-Muster von Anthropic zur Gauntlet Loop

Der Gauntlet Loop ist das Evaluator-Optimizer-Muster mit drei Härtungen: Die Welt ersetzt die Rubrik, eine Blindauswahl ersetzt die Bewertungen, und das Gewinnen ersetzt die Rundenbudgets.

Vom Evaluator-Muster von Anthropic zur Gauntlet Loop

Von Anthropics Evaluator-Muster zur Gauntlet Loop

Die Gauntlet Loop ist nicht aus dem Nichts entstanden. Ihr Gerüst ist das Evaluator-Optimizer-Muster, das Anthropic in seinem Engineering-Leitfaden zum Aufbau effektiver Agenten beschreibt: Eine Komponente generiert, eine andere bewertet anhand von Kriterien, und das Paar iteriert. Was Matt Shumers Version hinzufügt, ist eine Reihe von klaren Entscheidungen, die ein vernünftiges Muster in ein zuverlässiges verwandeln.

Das Evaluator-Muster, Lehrbuchversion

Der Generator erstellt einen Entwurf. Der Evaluator bewertet ihn anhand von Kriterien. Wenn die Schwelle unterschritten wird, geht Feedback zurück an den Generator. Wiederholen. Das funktioniert, wenn Bewertung tatsächlich einfacher ist als Generierung, was für die meisten kreativen und visuellen Arbeiten gilt: Zu erkennen, dass eine Landingpage besser ist als eine andere, ist weitaus einfacher, als die bessere zu erstellen.

Wo die Lehrbuchversion leakt

Drei Stellen, an denen sich Selbsturteil wieder einschleicht:

  • Kriterien als Wörter. Wenn der Evaluator gegen eine schriftliche Bewertungsgrundlage urteilt, darf das Ökosystem des Generators die Wörter interpretieren, und Interpretation neigt dazu, das Bestehen zu begünstigen.
  • Bewertungen. Numerische Noten driften über Runden hinweg nach oben, weil sie an Erwartungen verankert sind, nicht an der Realität.
  • Rundenbudgets. „3 Mal iterieren“ beendet die Schleife nach Zeit, nicht nach Qualität.
  • Die drei Härtungen der Gauntlet

    Die Gauntlet Loop patcht jedes Leck mit etwas Äußerem:

  • Kriterien werden zu einem benannten, abrufbaren Artefakt - das tatsächliche Call of Duty, die tatsächliche Wettbewerberseite. Die Welt ersetzt die Bewertungsgrundlage.
  • Bewertungen werden zu einer blinden binären Auswahl - welche ist besser, Beschriftungen entfernt. Ein Bit, kein Driften.
  • Das Budget wird zu einem verdienten Ausstieg - die Schleife endet, wenn die Auswahl umschlägt, oder wenn ein Mensch sie stoppt.
  • Plus eine organisatorische Maßnahme, die das Lehrbuch implizit lässt: Builder und Kritiker sind separate Agenten mit separaten Kontexten, sodass der Evaluator nicht die Bindung des Generators an seine eigene Arbeit erben kann.

    Warum das über eine virale Demo hinaus wichtig ist

    Das gehärtete Muster ist allgemein: Jede Generate-Evaluate-Schleife, die du betreibst (Code-Review-Bots, Content-Pipelines, Agent-QA), wird mit denselben drei Patches ehrlicher. Die Gauntlet Loop ist der einprägsame Beweis, dass sie in großem Maßstab funktionieren - 55.000 Zeilen Beweis. Beginne mit Was ist die Gauntlet Loop, dann schreibe deine eigene.

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents