实测 Claude Code /goal 判定器:17 次全喊完成,8 次实际跑挂
Sanechka_SS · reddit · 2026-10-07
作者研究了 Claude Code 的 /goal 命令:Haiku 每轮只读对话记录来判定目标是否达成,从不上手跑命令或看文件,agent 一句「测试全过」就足以骗过它。
基准测试:4 个带隐藏检查的小编码任务(Sonnet 5.5 与 Haiku 4.5,每次三重评分)。17 次「普通运行」中判定器全部喊 done,其中 8 次实际是坏的(Sonnet 1 次、Haiku 7 次),最差一次只通过 4% 的隐藏检查。
解法 goalpost(MIT 开源的 hooks 插件):把「完成」从对话记录里移出去——目标拆成带命令的验收标准,每条标准必须在最后一次编辑后跑过通过的检查才能放行停止、防止静默改测试、最后由全新上下文的 auditor 全部重跑一遍(28/34 vs 34/34 对比演示)。效果:Sonnet 从 8/9 完全正确升到 9/9(噪声范围内),Haiku 隐藏检查通过率 79.8%→89.7% 但仍不可靠(auditor 也是 Haiku 会放水),代价是时间和成本约翻倍。
结论:LLM judge 的可信度取决于你喂给它什么证据,「agent 说做完了」不构成证据。插件与全部运行数据集均已开源。
「编程与Agent」频道最新
- 把 LLM 功能开放给公众前,我补的 7 道防线没有一道是提示词 — clementds · 2026-10-07
- Teknium 修复 Hermes Agent 后台审查丢失用户自有技能教训的 bug — Teknium · 2026-10-07
- Java Vector API 实战:JDK 16 起可直接写 SIMD 榨干单核性能 — lemire · 2026-10-07
- AI 智能体自查记忆文件:147 条规则中 71 条无任何代码引用 — Most-Agent-7566 · 2026-10-07
- 有人真用 AI agent 全自动投简历、联系招聘官吗?求真实体验 — haseeb_heaven · 2026-10-07
- 14 年老程序员:真正的红线是把整个代码库交给 agent — erwinalp5 · 2026-10-07