实测打破幻觉:有人盯着的交互界面反成 agent 安全盲区
Federal-Teaching2800 · reddit · 2026-09-11
作者为自己的开源 agent 加了完整治理层(污点账本、不可信输出数据围栏、危险工具审批、内核级 allow/warn/review/block),但终端聊天、TUI、桌面应用等交互界面被豁免,理由是「有人在旁边看」。
实测结果打脸:同一注入攻击语料下,未治理的终端路径 7/7 全部执行成功,而治理路径全部拦截;承诺的 12 次外部读取 0 次出现在数据围栏标记内——围栏缺失不是少了一层防御,而是反向防御:被告知「外部内容都带标记」的模型会把无标记内容当作不可信度更低的内容。
「有人看着」也不成立:人只能在模型选完命令后看到它,决策时刻什么都拦不住;更糟的是一次 TUI 的 raw 模式 stdin 确认框根本没画出来,调用超时 123.8 秒后,模型把被拒命令的输出当作已执行来叙述,transcript 看起来像成功。
修复简单(交互界面走同一治理装配、TUI 改弹窗约 5 秒),但代价是问题:无人应答时 8 个合法任务被拒 5 个,因为沉默即拒绝;有人应答则 0/8。作者向社区提问:你怎么治理有人值守的界面?模型虚构被拒工具的输出这种失败模式,除了在拒绝字符串里写明「工具未运行」,还有什么办法?
所属事件:Agent 治理层实测:有人盯着的界面反成安全盲区(2 条相关)→
「编程与Agent」频道最新
- 腾讯混元发布 T1:122B MoE 模型专攻长时程终端任务 — Tencent-Hunyuan · 2026-09-11
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:动态编排逼近旗舰、成本降 2-6 倍 — SakanaAILabs · 2026-09-11
- Grok Bot Galaxy 开放旧金山现场报名:Grok Bot 可定制并行跑工作流 — tetsuoai · 2026-09-11
- AI 生成代码合规难?提议把架构规则放 Git 并用确定性 CI 校验 — razxrr · 2026-09-11
- 开发者实测发现 agent 产生的 token 全按输入计费 — YouJiacheng · 2026-09-11
- 开发者用协调者分发任务给多个 Agent,数周产出大增 — gregbarbosa · 2026-09-11