Blog›Guides

AnthropicのEvaluatorパターンからGauntlet Loopへ

gauntlet loopは、評価者-オプティマイザーパターンに3つの強化を加えたものです。世界がルーブリックを置き換え、ブラインドピックがスコアを置き換え、勝利がラウンド予算を置き換えます。

AnthropicのEvaluatorパターンからGauntlet Loopへ

Anthropicの評価者パターンからGauntlet Loopへ

Gauntlet Loopはどこからともなく現れたわけではない。その骨格は、Anthropicが効果的なエージェント構築に関するエンジニアリングガイドで説明する評価者・最適化者パターンである。一方のコンポーネントが生成し、もう一方が基準に照らして評価し、そのペアが反復する。Matt Shumerのバージョンが追加するのは、合理的なパターンを信頼できるものへと変える一連の明確な選択である。

教科書版の評価者パターン

生成者がドラフトを作成する。評価者が基準に照らして採点する。閾値を下回れば、フィードバックが生成者に戻る。繰り返す。これは、評価が生成よりも本質的に簡単な場合に機能し、それはほとんどの創造的・視覚的作業に当てはまる。あるランディングページが別のものより優れていると認識することは、より良いものを作り出すことよりはるかに簡単だからだ。

教科書版が漏れる箇所

3つの箇所があり、すべて自己判断が忍び込む場所である:

  • 基準としての言葉。 評価者が書かれたルーブリックに照らして判断する場合、生成者のエコシステムがその言葉を解釈することになり、解釈は合格へと傾く。
  • スコア。 数値による評価は、世界ではなく期待に固定されているため、ラウンドを重ねるごとに上昇していく。
  • ラウンド予算。 「3回反復する」は、品質ではなく時間でループを終了させる。
  • Gauntletの3つの強化

    Gauntlet Loopは、それぞれの漏れを外部の何かで補修する:

  • 基準は名前付きで取得可能な成果物となる。実際のCall of Duty、実際の競合ページ。世界がルーブリックに取って代わる。
  • スコアはブラインドの二者択一となる。どちらが優れているか、ラベルを剥がして選ぶ。1ビットで、ドリフトなし。
  • 予算は獲得した退出となる。選択が反転したとき、または人間が停止したときにループは終了する。
  • さらに、教科書が暗黙のままにしている組織的な動きが1つある。ビルダーと批評家は別々のコンテキストを持つ別々のエージェントであり、評価者が生成者の自分の作品への愛着を受け継ぐことができないようにする。

    これが1つのバイラルデモを超えて重要な理由

    強化されたパターンは一般的である。実行するあらゆる生成・評価ループ(コードレビューボット、コンテンツパイプライン、エージェントQA)は、同じ3つのパッチでより正直になる。Gauntlet Loopは、それらが大規模に機能することを示す記憶に残る証明であり、55,000行の証明である。Gauntlet Loopとは何かから始め、次に自分で書く。

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents