让编码Agent先过外部验证再算完成
Hefty-Citron2066 · reddit · 2026-07-17
这条 Reddit 讨论的重点是:跑长时间 coding-agent 任务时,外部验证比让同一个 agent 自己说“我修好了”更可靠。
作者的做法是把验证单独拆成一个阶段:
- agent 负责改代码
- 部署后的应用由外部浏览器/API 测试去跑
- 再把失败结果回传给 agent
他用的是 TestSprite 配合 Claude Code。安装流程大致是 Node 20+、执行 setup、填 API key,然后安装 agent skill 文件。CLI/前端是 Apache 2.0,但执行后端是托管的,所以需要账号和 key;如果你要求完全自托管,这点要注意。
帖子里强调,真正有用的是失败包:
- 失败步骤
- 截图
- DOM
- 可能的根因推断
- 建议修复方向
他举了一个登录流的例子:agent 只看 API 测试会误判“已修复”,但浏览器里实际是 session cookie 路径错误;有截图和 DOM 后,下一轮补丁才变得合理。
结论是:核心逻辑仍然应该保留人工测试;但对 agent 写出来的 UI glue 和 e2e 流程,外部“完成信号” 比再生成一堆单元测试更有价值。
所属事件:外部自动验证是提升编码Agent产能的关键(2 条相关)→
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11