译自英文

gauntlet循环是一种代理式提示模式,其中构建者和批评者代理针对明确的质量标准进行迭代,通过盲比较,直到输出超过参考标准。

gauntlet loop是一种智能体提示模式,其中AI智能体系统针对明确的质量标准对一项工作进行迭代,使用分离的构建者和批评者角色以及盲比较,直到输出超越具体参考。该技术由开发者Matt Shumer在2026年推广,他创造了这一名称,并用它构建了“Claude of Duty”,这是一款由智能体在智能体编码框架内端到端生成的浏览器游戏。

工作原理

gauntlet loop从两个输入开始:一个宏大的目标和“优秀”样子的具体示例(参考)。主导智能体随后:

  1. 设定标准。 参考被视为要超越的标准,而非灵感来源。
  2. 分解工件,将其拆分为可以独立改进和评判的最小部分。
  3. 分配构建者。 每个重要部分交给一个构建者智能体,由其生成或修订该部分。
  4. 盲评。 一个具有全新上下文的独立批评者智能体将当前输出与参考进行盲A/B测试比较,不知道哪个是哪个。
  5. 找出最大差距。 如果输出落败,批评者指出最大的实质性差异,这成为下一个构建目标。
  6. 循环,直到输出在比较中胜出或达到停止条件。

构建者与批评者之间的分离很重要:具有全新上下文的评判者避免了模型评估自身工作的自我评分偏差,而盲A/B框架迫使进行具体比较,而非泛泛的赞美。

要求与用途

gauntlet loop在诸如Claude Code或Codex等智能体框架内运行,其中智能体可以打开文件、运行代码、渲染结果、检查截图并生成子智能体。该模式适用于任何可以检查和改进的工件:代码、网站、产品设计、营销素材、写作和研究。它属于更广泛的智能体自我改进技术家族,与批评者-验证者流水线和多智能体系统中的评判小组并列。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:Prompting techniques·Agentic AI
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史