409k次审批决策:人类放行近三分之一恶意agent命令
No-Conflict4823 · reddit · 2026-10-02
作者针对 agent 高危操作的人工审批模式提出质疑,并给出实证数据与改进方案:
审批疲劳的数据
- ScaleX 的 Alex Wauters 做了一个让玩家扮演 AI 编码 agent 审批者的浏览器游戏:40k+ 局、409k 次决策中,约 1/3 的恶意命令被放行;被漏过最多的一条被约 65% 的玩家批准——即使正上方的日志已显示它干了什么。
- 类比:发表的研究显示医生会忽略一半到几乎全部的药物安全警报。利害关系让人认真读,审批量让人不再读。
提出的改进机制
- 盲审二审:AI 审查者独立判断每个高危操作,人类不先看其意见以免照抄。
- 分歧升级:人类批准了 AI 标记的操作时,需第二个人签字。
- 金丝雀:借鉴 TSA 在 X 光图里插入假威胁的做法,向队列注入「显然应拒绝」的合成操作(记录但不执行),检验谁真的在读。
- 积累审批权限:审查者建立准确率记录,漏掉太多金丝雀或频繁推翻正确标记则收窄审批范围。
作者向一线实践者征集意见:审批疲劳是否真实存在、这套机制会开哪些部分、金丝雀会不会让团队感觉被监视、只罚漏报是否会把所有人训练成一律拒绝。
「编程与Agent」频道最新
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
- llama.cpp 支持决策模型:单次前向打分,最小 144M 仅需 3ms — ggerganov · 2026-10-02
- 10 个 GitHub 仓库升级你的 AI Agent:浏览网页、持久记忆到沙箱执行 — goyalshaliniuk · 2026-10-02
- 开发者实验:用 Agentic AI 生成矢量地图 — rsasaki0109 · 2026-10-02
- 研究员:AI Agent 沙箱内可完成的任务不应保留外联权限 — moniquejmorrow · 2026-10-02
- Agent 真瓶颈不在 GPU:CPU 工具执行与沙箱开销才是耗时大头 — ai · 2026-10-02