Blog›Guides

ガウントレット・ループが壊れる5つの方法(そしてそれぞれの修正方法)

曖昧なバー、自己採点するビルダー、甘い批評家、固定ラウンド数、そして判断するには大きすぎる作品:5つの予測可能な失敗とその修正策。

ガウントレット・ループが壊れる5つの方法(そしてそれぞれの修正方法)

ガントレットループが壊れる5つの方法(そしてそれぞれの修正方法)

ガントレットループは外から見ると堅牢に見える:ビルダー、批評家、バー、反復。実際には、最初の実行のほとんどは失敗し、予測可能な方法で失敗する。ここでは、私たちが見る5つの失敗モードを、悪い順に挙げる。

1. 曖昧なバー

最も一般的なキラー。バーが「受賞歴のあるデザイン」や「ワールドクラスの文章」の場合、批評家は取得するものがないので、比較をでっち上げてすべてを承認する。ループは幸せに回転し、自信を持って凡庸さを生み出す。修正:バーは名前が付けられ(特定のページ、投稿、リポジトリ)、取得可能で(批評家が開いたりスクリーンショットを撮ったりできる)、比較可能でなければならない(両方の成果物を並べて置ける)。バーにURLを貼り付けられないなら、まだバーはない。

2. ビルダーが自分自身を採点する

同じエージェントコンテキストが構築と判断を行うと、判断は努力、愛着、疲労といったすべてのバイアスを引き継ぐ。修正:批評家は新鮮なコンテキストを持つ別のサブエージェントである。それは2つの成果物だけを見て、他には何も見ない - 計画も、ラウンド数も、言い訳も。

3. 甘い批評家

「これはどれくらい良いか、1-10で?」と聞かれた批評家は、7、次に8、次に9と答える。スコアは期待に対して判断され、期待は動くため、ドリフトする。修正:批評家に二値の仕事を与える。どちらが良いか、AかBか、ラベルを外して?そして、バーが勝ったときに最大のギャップを1つ挙げることを要求する - そのギャップが次のラウンドの全指示となる。

4. 固定されたラウンド数

「5回改善する」は、モデルが楽をしたいと感じた瞬間に正確に停止する。作品が素晴らしいかゴミかに関係なく。修正:終了条件は盲目的比較に勝つこと、または人間が呼び止めること。それ以外はループを終了させない。

5. 判断するには大きすぎるピース

批評家はヒーローセクション、武器モデル、1つのチャートを比較できる。しかし「アプリ全体」を一目で正直に比較することはできないので、切り上げてしまう。修正:目標を、盲目的選択が意味を持つほど小さな成果物に分割し、各ピースをガントレットにかける。

修正の背後にあるパターン

すべての失敗は同じ失敗である:どこかで、自己判断が漏れ込んでいる。テンプレートは5つの修正をすべてコード化しており、注釈付きオリジナルはそれらをShumer自身の言葉で示している。

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents