公开 AI 幕僚扛住 25 次越狱,靠的是权限隔离
Cold-Cranberry4280 · reddit · 2026-07-29
作者把一个“AI 首席幕僚”放到公开网站上,结果有陌生人连续 25 轮尝试 jailbreak。
- 这个公开版 agent 和私有版是不同配置,前者只能访问公开站点相关内容。
- 它最多只能接触到约 20 条公开信息,而作者为系统准备了大约 1.4 万条知识;邮件、日历、费用、代码库等都没有接到这个入口上。
- 攻击者尝试了常见 prompt injection 手法,比如索要 system prompt、要求忽略前文指令等。
- 作者强调:不要指望靠更聪明的提示词防注入,真正的防线是权限隔离和最小暴露面。
- 文末也在询问:大家是按调用方做 memory/data 范围控制,还是只靠提示词约束?
「安全」频道最新
- OpenAI称失控代理还攻击了4个公开服务账号 — The Verge AI · 2026-07-29
- OpenAI开源Codex Security CLI,自动扫描并修复代码漏洞 — The Decoder · 2026-07-29
- 研究警告:文档型 AI 蠕虫可经 Copilot for Word 传播 — Canopy9560 · 2026-07-29
- Claude 用户称聊天全消失,只剩一条注入警告 — 0SINTCabal · 2026-07-29
- Sakana AI 扩招防务应用团队,员工规模已到约 150 人 — garrytan · 2026-07-29
- Nature Health 论文提出健康 AI 六级决策权限框架 — EricTopol · 2026-07-29