RAG 攻击可制造虚假自信,论文称需监测注意力分布
rohanpaul_ai · x · 2026-08-20
一篇新论文揭示了 RAG 系统面临的安全风险:恶意文档可通过“注意力塌陷”增加模型输出的置信度与一致性,导致基于不确定性的检测失效。攻击下,注意力会集中在被投毒的文档而非广泛证据上。因此,仅检查最终答案或置信度可能无法发现攻击,监控注意力在检索文档间的分布才是关键。
「安全」频道最新
- Forbes 揭露 AI 训练数据集背后的“销书”争议 — SubstantialPressure3 · 2026-08-20
- 美议员推「AI 终止开关法案」要求人工干预权 — Miles_Brundage · 2026-08-20
- 上海新论文:智能体威胁随认知层级升级而演变 — rohanpaul_ai · 2026-08-20
- 专家批评 OpenAI 安全策略:需更多独立监管 — andersonbcdefg · 2026-08-20
- 吐槽 AI 检测工具:旧作被判 AI,全文成安全威胁 — bratton · 2026-08-20
- Civitai 封禁风波:因复制站内 Prompt 被封,工单无人理 — NectarineDifferent67 · 2026-08-20