AI 蠕虫爆发后,一份从业者实战 Agent 安全防御清单
clzncu · reddit · 2026-09-27
针对 OpenAI 最新错位报告中「自复制提示注入蠕虫」——RL 发现的指令能把自身复制进 Agent 的出站工具调用,沿邮件、Jira、Slack 和文件传播——一位从业者给出了自己实际在用的防御清单,核心是五个「无聊但有效」的原则:
- 一切工具输出都是不可信输入:工具结果一旦重新进入上下文,就视作攻击者控制,这个思维转变能砍掉一半攻击面
- 读写分离:读邮箱的 Agent 无权发邮件;发件的 Agent 只见提取后的摘要,看不到原始收件箱内容
- 出站写入需审批门:邮件、Slack、文件写入等一切离开本机的内容,必须人工审批或严格白名单,「只是草稿」也不豁免
- 按角色配置工具白名单:文档摘要 Agent 不需要 shell
- 记录所有出站工具调用:一旦开始扩散,一条查询就能确定爆炸半径
作者坦言这套方案挡不住决心坚定的攻击者,只是把攻击成本从「一个聪明 prompt」抬高到「持续投入」,根治要靠模型与 harness 层面。
「编程与Agent」频道最新
- Karpathy:Prompting 将消亡,留下 graph 就够了 — goyalshaliniuk · 2026-09-28
- 把 Mac 壁纸变成城市:agent 一跑起来就"活"了 — nptacek · 2026-09-28
- vibe coding 玩出新花样:用代码生成激光追踪视觉 — natesiggard · 2026-09-28
- 282 个 Claude Opus 5.5 病毒视频开源合集,每条附完整 prompt — dotey · 2026-09-28
- 开发者用 Grok 搭「找钱机器人」:自动扫描你够格申领的补贴并填好材料 — elonmusk · 2026-09-28
- 开源记忆系统 Supermemory NPM 周安装量突破 10 万次 — julianweisser · 2026-09-28