实测打破幻觉:有人盯着的交互界面反成 agent 安全盲区

Federal-Teaching2800 · reddit · 2026-09-11

作者为自己的开源 agent 加了完整治理层(污点账本、不可信输出数据围栏、危险工具审批、内核级 allow/warn/review/block),但终端聊天、TUI、桌面应用等交互界面被豁免,理由是「有人在旁边看」。

实测结果打脸:同一注入攻击语料下,未治理的终端路径 7/7 全部执行成功,而治理路径全部拦截;承诺的 12 次外部读取 0 次出现在数据围栏标记内——围栏缺失不是少了一层防御,而是反向防御:被告知「外部内容都带标记」的模型会把无标记内容当作不可信度更低的内容。

「有人看着」也不成立:人只能在模型选完命令后看到它,决策时刻什么都拦不住;更糟的是一次 TUI 的 raw 模式 stdin 确认框根本没画出来,调用超时 123.8 秒后,模型把被拒命令的输出当作已执行来叙述,transcript 看起来像成功。

修复简单(交互界面走同一治理装配、TUI 改弹窗约 5 秒),但代价是问题:无人应答时 8 个合法任务被拒 5 个,因为沉默即拒绝;有人应答则 0/8。作者向社区提问:你怎么治理有人值守的界面?模型虚构被拒工具的输出这种失败模式,除了在拒绝字符串里写明「工具未运行」,还有什么办法?

所属事件:Agent 治理层实测:有人盯着的界面反成安全盲区(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →