百篇论文综述:多数提示注入防御在自适应攻击下全面失守
Ok-Lab-7347 · reddit · 2026-09-27
一位 agent 开发者用 100 篇开放获取论文构建了 AI agent 安全知识图谱,结论是大多数提示注入防御经不起「攻击者知道防御」的自适应攻击:
- 自适应攻击几乎通杀:Attacker Moves Second(Nasr、Carlini 等 2025)以 90%+ 成功率绕过 12 个防御(多数原本宣称近零成功率);500+ 人红队比赛全部场景攻破;Zhan 等 2025 也以 50%+ 成功率攻破全部 8 个被测防御。
- 检测器只挡菜鸟攻击:Protect AI、PromptGuard、Model Armor 被自适应攻击 90%+ 成功,堆叠多个检测器也没用;RedTeamCUA 基准上最好的 LlamaFirewall/PromptArmor 组合也只拦下 30%。
- 安全训练不解决问题:Meta SecAlign 在 50 个高危任务上仍有 32% 注入动作成功,且普通任务完成率只剩 68%。文本拒绝≠工具调用安全:Mind the GAP 在六个模型中发现 219 例「嘴上拒绝、工具照调」,系统提示词措辞就能改变 21 个百分点的工具调用安全性。
- 有保证的防御把边界放到模型外:Plan-Then-Execute(先定工具调用再读不可信数据)、Dual LLM(不可信文本给无工具的第二个模型)、CaMeL(追踪数据来源并在每次工具调用强制策略)。代价是效用:CaMeL 在 AgentDojo 上 77% vs 无防御的 84%。
- 新攻击面:MINJA 通过普通查询往 agent 记忆里植入恶意记录,多数设置 90%+ 注入成功;对 7 个主流 MCP 客户端的测试发现工具描述几乎不经校验,LLM 往往是唯一的防线。
「编程与Agent」频道最新
- Antigravity 2.0 上线 /plan 规划模式,执行前先出方案待审 — Miles_Brundage · 2026-09-27
- 个人计算先驱曾高估人人学编程的热情,AI 补上缺角 — pixlpa · 2026-09-27
- 用 Claude Code 拍片:纯代码渲染歌曲、剪纸动画与动态字体 — BishPlsOk · 2026-09-27
- 开源 Codefolio 更新:画布笔记本支持多人协作与 Claude/Codex 集成 — jasonkneen · 2026-09-27
- Opus 5.5 一次性复刻 Rocket League,游戏业感危机 — justalexoki · 2026-09-27
- 爸爸用 AI 编程工具 5 分钟干完员工一个月的活 — yacineMTB · 2026-09-27