20 个 Agent 80 万次测试跑下来,难点全在「如何证明它们没撒谎」
Grimmoner · reddit · 2026-10-09
一位非职业工程师用 AI 辅助开发了一个 20 个 agent 的多智能体系统,迭代到第三版。他发现让 agent 干活已不是难题,难的是证明它们确实做了自己声称的事:任务被标记为「已验证」时应用甚至无法启动、检查失败仍报成功、重试造成重复工作。
新一版迭代全部围绕治理、问责与证据链构建:
- 哈希链式审计账本、确定性策略检查、行动契约、人工审批与独立验证流程
- 6,111 次记录在案的测试运行、805,299 次测试用例执行
- 4,525 次由 review agent 执行(约占 74%),19 轮对抗式审查产生 648 项发现,变异测试杀死率 95.4%
- 首次真实试点 5 张工单,4 张自动验证通过,第 5 张暴露出验证逻辑本身的问题
关键教训:绿色对勾本身毫无意义,如果检查本身就是错的——他最近就发现了过期失效的回归测试。系统目前仍运行在「影子模式」,只观察不拦截,直到证据足够支撑授权。作者计划未来开源部分内容。
「编程与Agent」频道最新
- Higgsfield 推出 Katana:在 Claude 内做 AI 视频剪辑 — CurieuxExplorer · 2026-10-09
- vLLM 生产环境坑:GPU 故障可致 K8s 节点报废,推理是有状态负载 — tianyin_xu · 2026-10-09
- Addy Osmani 长文:Agent 时代工程师的三种快乐,最先流失的是「直觉」 — addyosmani · 2026-10-09
- AI 质量检查第三步:相关性与指令遵循的自动化判定 — goyalshaliniuk · 2026-10-09
- AI 应用上线的 7 项自动化质检:测试全过也可能在生产翻车 — goyalshaliniuk · 2026-10-09
- 开发者吐槽:Codex/ChatGPT 需要「真正聪明」的模型路由器 — flowersslop · 2026-10-09