ガントレットループは、エージェント的プロンプティングのパターンであり、AIエージェントシステムが、明示的な品質基準に対して作業を反復的に改善し、分離されたビルダー役と批評役、およびブラインド比較を用いて、出力が具体的な参照を上回るまで繰り返すものである。この手法は、2026年に開発者のマット・シューマーによって普及され、彼がこの名称を考案し、エージェント的コーディングハーネス内でエージェントがエンドツーエンドで制作したブラウザゲーム「Claude of Duty」の構築に使用した。
仕組み
ガントレットループは、野心的な目標と、「優れた」状態の具体的な例(参照)という2つの入力から始まる。リードエージェントは次のことを行う:
- 基準を設定する。 参照は、インスピレーションではなく、打ち負かすべき標準として扱われる。
- 成果物を分解する 独立して改善・判断できる最小の部分に分解する。
- ビルダーを割り当てる。 各重要な部分は、それを生成または改訂するビルダーエージェントに割り当てられる。
- ブラインドで判定する。 新しいコンテキストを持つ別の批評エージェントが、現在の出力を参照とブラインドA/Bテストとして比較し、どちらがどちらかを知らない状態で判定する。
- 最大のギャップを見つける。 出力が負けた場合、批評者は最も大きな意味のある違いを挙げ、それが次のビルドターゲットとなる。
- ループする 出力が比較に勝つか、停止条件に達するまで繰り返す。
ビルダーと批評者の分離は重要である:新しいコンテキストの判定者は、モデルが自身の作業を評価する際の自己採点バイアスを回避し、ブラインドA/Bフレーミングは、一般的な賞賛ではなく具体的な比較を強制する。
要件と用途
ガントレットループは、Claude CodeやCodexなどのエージェント的ハーネス内で実行され、エージェントはファイルを開いたり、コードを実行したり、結果をレンダリングしたり、スクリーンショットを検査したり、サブエージェントを生成したりできる。このパターンは、検査・改善可能なあらゆる成果物(コード、ウェブサイト、製品デザイン、マーケティング資産、文章、研究)に適用できる。これは、マルチエージェントシステムにおける批評者・検証者パイプラインや判定者パネルと並んで、エージェント的自己改善手法のより広いファミリーに属する。