审计 1228 次人工干预:91% 非决策,agent 8-11% 假完工

kraboo_team · reddit · 2026-09-28

一支运营约 25 个 AI agent 工作区(PM→Dev→Tester→Critic→Release 流水线,靠 PASS/RELEASEREADY 等标记交接)的团队,审计了 8 周共 1228 次人工干预,发现:

改进方案:保持各 agent 不变,新增一个小型 MCP 服务作为唯一真相源:

目前先以 shadow mode 只记录不拦截。作者还向社区提问:如何测量 verifier 的漏检率、如何处理主观检查而不让 LLM judge 重新成为权威、是否有人做 Done 之后的持续复验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →