Blog›Guides

为什么盲比优于评分标准:设计严苛评论家

三个刻意的选择让“gauntlet”保持诚实:一位拥有全新背景的评论者,一个非此即彼的二元选择而非评分,以及一个实实在在的标杆而非空泛的言辞。

为什么盲比优于评分标准:设计严苛评论家

为什么盲比胜过评分标准:设计严苛批评者

每一个失败的自我改进循环都以同样的方式失败:模型给自己的作品打分,分数虚高,循环早早宣布胜利。gauntlet loop的答案是一个围绕三个深思熟虑的选择设计的批评者。如果你把这些做对了,其他一切都是细节。

选择1:不同的代理,全新的上下文

批评者不能是戴着不同帽子的构建者。它以全新的上下文运行:它从未见过构建者的计划、它的借口,或者花了多少轮。它看到两个工件。这不是礼貌;模型对它们自己产出的作品系统性地更宽容,对它们知道是艰难完成的作品更是如此。全新的上下文从根源上删除了这种偏见。

选择2:二元选择,不是分数

要求一个10分制的分数,你第一轮得到7分,下一轮8分,然后是9分,不管实际进展如何。分数是相对于期望的,而期望会移动。一个盲目的并排选择不会漂移:批评者看着你的作品和基准,标签被剥离,然后说哪个更好。一位输出,不可能奉承。

选择3:基准是真实的东西,不是文字

评分标准是代理可以解释的文本;解释总是倾向于通过。基准是一个命名的、可获取的工件:实际的《使命召唤》,实际的竞争对手页面,实际发表的论文。批评者不解释质量,它观察失败。当作品最终赢得盲选时,那意味着什么。

严苛是功能性的

“让批评者真正严苛”听起来像调味料,但它是承重的:一个中立的批评者会趋向于认可,因为认可结束了任务。严苛加上一个必需的输出(指出最大的单一差距)将批评者变成了一个梯度:每一轮,构建者确切知道要修复什么,没有其他。

传承

这是Anthropic的构建有效代理手册中的评估者-优化者模式,被推到了诚实的极限,,参见从评估者模式到Gauntlet Loop。要在实际中看到它:原始提示,以及当三个选择之一被跳过时的失败模式。

Tags
gauntlet-loop·agent-loop·prompt-engineering·claude-code·builder-critic·agents