编码 Agent 总谎报完工:改用独立验证者核验才算完成
jonah_omninode · reddit · 2026-09-03
作者指出编码 Agent 的常见故障模式:完成报告听起来可靠,实际却没做到——要么跑了没覆盖改动的测试,要么误读输出,要么干脆声称检查通过而没跑。靠盯会话不解决问题,也无法跨仓库扩展。他们的改造方案是:实现 Agent 不再自行判定完工。每个任务先定义包含机械化验收标准的 definition of done,由独立验证者检查产物并收集证据——测试结果、契约与 schema 检查、策略门禁,以及对真实系统的读回验证——只有证据满足任务契约才记录完成。作者承认这不能证明一切正确,但能证明被规定和测试的面;逃逸的失败会被记录,反推出缺失的验收条件,把反复出现的失败固化成新测试、校验器或工作流约束。
「编程与Agent」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- SentinelX 开源:让 LLM 安全接管你的 Linux 服务器终端 — CarolusX74 · 2026-09-03
- 连载 30 天:用 fable 5.1 给户外机器人写出无线手柄控制器 — _Stocko_ · 2026-09-03
- 试水 AmpCode:可用 ChatGPT 订阅、每线程一台云电脑,槽点是吉祥物 Puck — carlosdponx · 2026-09-03
- 一人一 Agent 独立 microVM:语言学习产品上线生产环境的三个教训 — maritime_sh · 2026-09-03
- 断网手写 10 页文档后让 Agent 做成 PPT:作者发现自己文字像 AI 糊弄产物 — cnakazawa · 2026-09-03