なぜルーブリックより盲比較が優れているのか:厳しい批評家の設計
三つの意図的な選択が、ガントレットの誠実さを保つ:新鮮な文脈を持つ批評家、スコアではなく二者択一の選択、そして言葉ではなく実物である基準。

ブラインド比較がルーブリックに勝る理由:厳しい批評家の設計
自己改善ループが失敗するとき、その失敗はいつも同じパターンを辿る。モデルが自分の成果を採点し、点数が膨らみ、ループが早期に勝利を宣言する。ガントレットループの答えは、三つの意図的な選択を中心に設計された批評家である。これらを正しく設定すれば、他のすべては細部に過ぎない。
選択1:別のエージェント、新鮮なコンテキスト
批評家は、作り手が別の帽子を被ったものではあってはならない。批評家は新鮮なコンテキストで動作する。作り手の計画、言い訳、何ラウンドかかったかを見たことがない。二つの成果物だけを見る。これは礼儀ではない。モデルは自分が生成した成果に対して体系的に甘く、それが困難だったと知っている成果にはさらに甘くなる。新鮮なコンテキストは、そのバイアスを根本から削除する。
選択2:スコアではなく、二択の選択
10点満点のスコアを求めると、最初のラウンドで7、次に8、その次に9となる。実際の進歩に関係なくだ。スコアは期待値に相対的であり、期待値は動く。ブラインドの二者択一はドリフトできない。批評家はあなたの成果と基準を見て、ラベルを剥がし、どちらが優れているかを言う。1ビットの出力で、お世辞を言うことは不可能だ。
選択3:基準は言葉ではなく、実在のもの
ルーブリックはエージェントが解釈するテキストであり、解釈は常に合格へと曲がる。基準は名前付きで取得可能な成果物である。実際のCall of Duty、実際の競合ページ、実際の公開エッセイ。批評家は品質を解釈せず、敗北を観察する。成果がついにブラインド選択で勝ったとき、それは何かを意味する。
厳しさは機能的である
「批評家を本当に厳しくする」は味付けのように読めるが、それは荷重を支える。中立的な批評家は承認に収束する。なぜなら承認はタスクを終わらせるからだ。厳しさと、一つの必須出力(最大のギャップを一つ挙げる)が、批評家を勾配に変える。毎ラウンド、作り手は何を直すべきかを正確に知り、それ以外は知らない。
系譜
これはAnthropicのbuilding-effective-agentsプレイブックからの評価者・最適化者パターンを、正直な極限まで押し進めたものだ。評価者パターンからガントレットループへを参照。実際の例を見るには:元のプロンプト、そして三つの選択のいずれかが省略されたときの失敗モードを参照。
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read