gauntlet loop是一种智能体提示模式,其中AI智能体系统针对明确的质量标准对一项工作进行迭代,使用分离的构建者和批评者角色以及盲比较,直到输出超越具体参考。该技术由开发者Matt Shumer在2026年推广,他创造了这一名称,并用它构建了“Claude of Duty”,这是一款由智能体在智能体编码框架内端到端生成的浏览器游戏。
工作原理
gauntlet loop从两个输入开始:一个宏大的目标和“优秀”样子的具体示例(参考)。主导智能体随后:
- 设定标准。 参考被视为要超越的标准,而非灵感来源。
- 分解工件,将其拆分为可以独立改进和评判的最小部分。
- 分配构建者。 每个重要部分交给一个构建者智能体,由其生成或修订该部分。
- 盲评。 一个具有全新上下文的独立批评者智能体将当前输出与参考进行盲A/B测试比较,不知道哪个是哪个。
- 找出最大差距。 如果输出落败,批评者指出最大的实质性差异,这成为下一个构建目标。
- 循环,直到输出在比较中胜出或达到停止条件。
构建者与批评者之间的分离很重要:具有全新上下文的评判者避免了模型评估自身工作的自我评分偏差,而盲A/B框架迫使进行具体比较,而非泛泛的赞美。
要求与用途
gauntlet loop在诸如Claude Code或Codex等智能体框架内运行,其中智能体可以打开文件、运行代码、渲染结果、检查截图并生成子智能体。该模式适用于任何可以检查和改进的工件:代码、网站、产品设计、营销素材、写作和研究。它属于更广泛的智能体自我改进技术家族,与批评者-验证者流水线和多智能体系统中的评判小组并列。