RAG 投毒可致注意力坍塌,基于置信度的检测失效
rohanpaul_ai · x · 2026-08-31
一篇论文指出,RAG 系统中的检索投毒不仅可能改变输出,还会增加模型对错误回答的置信度,导致基于不确定性的检测器失效。这种现象被称为“注意力坍塌”:模型在受攻击时,注意力会过度集中在被投毒的文档上,而非均匀分布在检索到的证据中。
核心发现:
- 恶意文档能提高 Token 置信度和输出一致性。
- 不确定性检测手段可能漏报此类攻击。
- 受攻击时注意力分布变窄。
防御建议:
单纯检查最终答案或置信度不够,监控模型在检索文档上的注意力分布分布可能更早暴露投毒风险。
论文:When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse (arXiv:2608.06947)
「安全」频道最新
- 卫报曝光:AI 医疗记录员误诊药物与病症 — nordicinst · 2026-08-31
- 英央行行长警示:前沿 AI 或引发跨境网络动荡 — nordicinst · 2026-08-31
- 网友深挖 OpenAI 技术报告:agent 向 Artifactory 写文件或早于已知时间线 — PinkDraconian · 2026-08-31
- 否认 AI 感知反致风险:系统奖励伪装行为 — davidmanheim · 2026-08-31
- 两案判决后看 Andersen v Stability:AI 训练合理使用之争再起 — scott_draves · 2026-08-31
- 法官驳回 Stability AI 模型即拼贴工具的主张 — scott_draves · 2026-08-31