InceptionRAG 攻击论文:休眠文档链诱导 RAG 多跳推理自产错误信息,成功率超 80%
chaumian · x · 2026-09-16
arXiv 论文 InceptionRAG 提出一种隐蔽的 RAG 语料投毒新范式:
- 核心思路:不注入单点显式恶意载荷,而是把攻击拆散成一串「休眠段落」,每段单独看完全无害,可绕过现有防御;但当被一起检索时,会诱导 LLM 通过多跳推理自行「推断」出目标错误信息(间接逻辑归纳)。
- 黑盒适配:提出零阶后缀优化(ZOSO)自动生成权威后缀,提升黑盒场景适用性。
- 效果:在 3 个数据集、3 个 LLM 上评估,即便在严格的防御下攻击成功率仍超过 80%,证明现有缓解机制对这类威胁不足。
「安全」频道最新
- 曝 Anthropic 与 OpenAI 安全投入仅占资本开支 1% — AlexTensor · 2026-09-16
- 扫描 53 个 MCP server:36% 评级 D/F,通病是权限过大 — BrilliantSecret143 · 2026-09-16
- CMU 提出后训练防御 DDO,可拦截拒绝方向消融攻击且成本降 30-450 倍 — CarnegieMellonU · 2026-09-16
- 美国民调:57%-71% 选民反对本地建 AI 数据中心;司法部力挺 OpenAI — emmanuelvivier · 2026-09-16
- Common Sense 评估:Perplexity 对儿童属「不可接受风险」 — emmanuelvivier · 2026-09-16
- 环球音乐起诉 DistroKid,指控其成「AI slop 工厂」涉千首侵权 — emmanuelvivier · 2026-09-16