Blog›Guides

5种Gauntlet循环中断的方式(以及如何修复每一种)

模糊的指标、自我评分的构建者、温和的批评者、固定的轮次数量以及大到无法评判的碎片:这五个可预见的失败及其解决方案。

5种Gauntlet循环中断的方式(以及如何修复每一种)

高筒循环失效的5种方式(以及如何逐一修复)

高筒循环从外部看似乎很稳健:构建者、批评者、一个标准、迭代。但实际上,大多数首次运行都会失败,而且失败方式是可预测的。以下是我们看到的五种失效模式,按严重程度从高到低排列。

1. 模糊的标准

这是最常见的致命问题。如果标准是“获奖级设计”或“世界级写作”,批评者就没有可对照的具体对象,于是它会自行编造一个比较对象,然后批准一切。循环愉快地运转,自信地产生平庸的结果。修复方法:标准必须被命名(一个具体的页面、帖子、仓库),可获取(批评者能打开或截图它),并且可比较(两个产物能并排展示)。如果你无法粘贴一个URL作为你的标准,那说明你还没有标准。

2. 构建者自我评分

如果同一个代理上下文既负责构建又负责评判,那么评判就会继承所有偏见:投入感、依恋感、疲劳感。修复方法:批评者必须是具有全新上下文的独立子代理。它只看到两个产物,其他什么都不看,,不看计划、不看轮次、不看借口。

3. 软弱的批评者

一个被问“这个有多好,1-10分?”的批评者会给出7分,然后8分,然后9分。分数会漂移,因为它们是相对于期望来评判的,而期望会移动。修复方法:给批评者一个二元任务。哪个更好,A还是B,去掉标签?并要求它在标准获胜时指出最大的差距,,这个差距就是下一轮的全部指令。

4. 固定的轮次

“改进5次”会在模型感觉可以轻松完成时停止,无论工作是好是坏。修复方法:退出条件是赢得盲选比较,或者由人类来叫停。除此之外,没有任何东西能结束循环。

5. 太大而无法评判的碎片

批评者可以比较一个英雄区块、一个武器模型、一张图表。但它无法在一次查看中诚实地比较“整个应用”,所以它会向上取整。修复方法:将目标拆分成足够小的产物,使盲选变得有意义,并对每个碎片进行高筒循环。

修复背后的模式

每次失效都是同一种失效:在某个地方,自我评判悄悄溜了回来。模板 包含了所有五种修复方法;带注释的原始版本 展示了它们在Shumer自己的话中的体现。

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents