20 个 Agent 80 万次测试跑下来,难点全在「如何证明它们没撒谎」

Grimmoner · reddit · 2026-10-09

一位非职业工程师用 AI 辅助开发了一个 20 个 agent 的多智能体系统,迭代到第三版。他发现让 agent 干活已不是难题,难的是证明它们确实做了自己声称的事:任务被标记为「已验证」时应用甚至无法启动、检查失败仍报成功、重试造成重复工作。

新一版迭代全部围绕治理、问责与证据链构建:

关键教训:绿色对勾本身毫无意义,如果检查本身就是错的——他最近就发现了过期失效的回归测试。系统目前仍运行在「影子模式」,只观察不拦截,直到证据足够支撑授权。作者计划未来开源部分内容。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →