实测 Claude Code /goal 判定器:17 次全喊完成,8 次实际跑挂

Sanechka_SS · reddit · 2026-10-07

作者研究了 Claude Code 的 /goal 命令:Haiku 每轮只读对话记录来判定目标是否达成,从不上手跑命令或看文件,agent 一句「测试全过」就足以骗过它。

基准测试:4 个带隐藏检查的小编码任务(Sonnet 5.5 与 Haiku 4.5,每次三重评分)。17 次「普通运行」中判定器全部喊 done,其中 8 次实际是坏的(Sonnet 1 次、Haiku 7 次),最差一次只通过 4% 的隐藏检查。

解法 goalpost(MIT 开源的 hooks 插件):把「完成」从对话记录里移出去——目标拆成带命令的验收标准,每条标准必须在最后一次编辑后跑过通过的检查才能放行停止、防止静默改测试、最后由全新上下文的 auditor 全部重跑一遍(28/34 vs 34/34 对比演示)。效果:Sonnet 从 8/9 完全正确升到 9/9(噪声范围内),Haiku 隐藏检查通过率 79.8%→89.7% 但仍不可靠(auditor 也是 Haiku 会放水),代价是时间和成本约翻倍。

结论:LLM judge 的可信度取决于你喂给它什么证据,「agent 说做完了」不构成证据。插件与全部运行数据集均已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →