Blog›Guides

なぜルーブリックより盲比較が優れているのか:厳しい批評家の設計

三つの意図的な選択が、ガントレットの誠実さを保つ:新鮮な文脈を持つ批評家、スコアではなく二者択一の選択、そして言葉ではなく実物である基準。

なぜルーブリックより盲比較が優れているのか:厳しい批評家の設計

ブラインド比較がルーブリックに勝る理由:厳しい批評家の設計

自己改善ループが失敗するとき、その失敗はいつも同じパターンを辿る。モデルが自分の成果を採点し、点数が膨らみ、ループが早期に勝利を宣言する。ガントレットループの答えは、三つの意図的な選択を中心に設計された批評家である。これらを正しく設定すれば、他のすべては細部に過ぎない。

選択1:別のエージェント、新鮮なコンテキスト

批評家は、作り手が別の帽子を被ったものではあってはならない。批評家は新鮮なコンテキストで動作する。作り手の計画、言い訳、何ラウンドかかったかを見たことがない。二つの成果物だけを見る。これは礼儀ではない。モデルは自分が生成した成果に対して体系的に甘く、それが困難だったと知っている成果にはさらに甘くなる。新鮮なコンテキストは、そのバイアスを根本から削除する。

選択2:スコアではなく、二択の選択

10点満点のスコアを求めると、最初のラウンドで7、次に8、その次に9となる。実際の進歩に関係なくだ。スコアは期待値に相対的であり、期待値は動く。ブラインドの二者択一はドリフトできない。批評家はあなたの成果と基準を見て、ラベルを剥がし、どちらが優れているかを言う。1ビットの出力で、お世辞を言うことは不可能だ。

選択3:基準は言葉ではなく、実在のもの

ルーブリックはエージェントが解釈するテキストであり、解釈は常に合格へと曲がる。基準は名前付きで取得可能な成果物である。実際のCall of Duty、実際の競合ページ、実際の公開エッセイ。批評家は品質を解釈せず、敗北を観察する。成果がついにブラインド選択で勝ったとき、それは何かを意味する。

厳しさは機能的である

「批評家を本当に厳しくする」は味付けのように読めるが、それは荷重を支える。中立的な批評家は承認に収束する。なぜなら承認はタスクを終わらせるからだ。厳しさと、一つの必須出力(最大のギャップを一つ挙げる)が、批評家を勾配に変える。毎ラウンド、作り手は何を直すべきかを正確に知り、それ以外は知らない。

系譜

これはAnthropicのbuilding-effective-agentsプレイブックからの評価者・最適化者パターンを、正直な極限まで押し進めたものだ。評価者パターンからガントレットループへを参照。実際の例を見るには:元のプロンプト、そして三つの選択のいずれかが省略されたときの失敗モードを参照。

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents