审计 1228 次人工干预:91% 非决策,agent 8-11% 假完工
kraboo_team · reddit · 2026-09-28
一支运营约 25 个 AI agent 工作区(PM→Dev→Tester→Critic→Release 流水线,靠 PASS/RELEASEREADY 等标记交接)的团队,审计了 8 周共 1228 次人工干预,发现:
- 只有约 9% 的人工干预是真正的决策,其余都是核验、收尾和重新分派工作
- 59% 的任务由人手动关闭,尽管 agent 早已声称完成
- 每 100 个任务中有 8-11 个是虚假的「已完成」:如声称推送 30 个文件但远端什么都没有,或 PASS 低于 critic 自身阈值
- 某个扫板 agent 占全部任务的 76%,其中 92-95% 的运行结果是「无操作」
改进方案:保持各 agent 不变,新增一个小型 MCP 服务作为唯一真相源:
- 按任务类型定义「工作契约」,列出必须为真的条件(链接可解析、UTM 完好、发布包在远端分支等)
- 检查由该服务在推送分支上运行,agent 看不到也改不了,部分检查隐藏
- 三态结果 PASS / FAIL / UNVERIFIED,无法证明的一律不算通过
- 只有该服务能设置「Done」,错误 agent 的标记被忽略
目前先以 shadow mode 只记录不拦截。作者还向社区提问:如何测量 verifier 的漏检率、如何处理主观检查而不让 LLM judge 重新成为权威、是否有人做 Done 之后的持续复验。
「编程与Agent」频道最新
- 同任务 27B 花 10 分钟,Qwen Flash Next 跑 2.5 小时引困惑 — poofph · 2026-09-28
- 免费开放加拿大隐私法 MCP 服务器,无需注册可直连 — masiha97 · 2026-09-28
- Muse 电话功能引热议:agent 商务不止 computer use — bansalg_ · 2026-09-28
- AI 客服最难测的不是答错,而是对愤怒客户说“谢谢😊” — BinVio · 2026-09-28
- 开发者汇总 Copilot Chat 在 VS Code 中的 UX 与可靠性缺陷 — DanWahlin · 2026-09-28
- Liquid AI 主张端侧跑 Agent:350M-2.6B 模型,推理零按 token 计费 — JosephJacks_ · 2026-09-28