Blog›Guides

从Anthropic的评估者模式到Gauntlet Loop

gauntlet loop 是评估者-优化者模式,带有三种强化:世界取代了评分标准,盲选取代了分数,获胜取代了回合预算。

从Anthropic的评估者模式到Gauntlet Loop

从Anthropic的评估者模式到Gauntlet循环

Gauntlet循环并非凭空出现。它的骨架是Anthropic在其构建高效智能体工程指南中描述的评估者-优化者模式:一个组件负责生成,另一个根据标准进行评估,两者反复迭代。Matt Shumer的版本所增添的,是一系列硬性选择,将一个合理的模式转变为可靠的模式。

评估者模式,教科书版本

生成器产生草稿。评估者根据标准对其进行评分。若低于阈值,则将反馈传回生成器。如此重复。这一模式在评估确实比生成更容易时行之有效,而这对于大多数创意性和视觉性工作来说成立:判断一个落地页优于另一个,远比制作出更好的那个要容易得多。

教科书版本的漏洞所在

有三个环节,会让自我评判悄然溜回:

  • 标准即文字。 若评估者依据书面评分标准进行判断,那么生成器所处的生态系统便会去诠释这些标准,而诠释往往会偏向于“通过”。
  • 评分。 数字评分在多次迭代中会逐渐上浮,因为它们锚定于预期,而非现实世界。
  • 迭代预算。 “迭代3次”这一指令,是按时间结束循环,而非按质量。
  • Gauntlet循环的三项加固

    Gauntlet循环针对每个漏洞,都引入了外部因素加以修补:

  • 标准变为一个具名、可获取的工件,,即真实的《使命召唤》游戏、真实的竞争对手页面。现实世界取代了评分标准。
  • 评分变为盲选二元判断,,只问哪个更好,去掉标签。一个比特,没有漂移。
  • 预算变为凭实力赢得的退出,,循环在判断翻转时结束,或由人类叫停。
  • 此外,还有一项教科书未明说的组织性举措:构建者与评估者是分离的智能体,各自拥有独立的上下文,因此评估者无法继承生成者对自己产出的偏爱。

    为何这超越了单个爆款案例

    这一加固模式具有普遍性:你所运行的任何生成-评估循环(如代码审查机器人、内容流水线、智能体质量保障)都能通过同样的三项修补变得更加诚实。Gauntlet循环正是这些方法在大规模下行之有效的有力证明,,5.5万行代码的证明。从什么是Gauntlet循环开始,然后编写你自己的版本。

    Tags
    gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents