RAG 攻击可制造虚假自信,论文称需监测注意力分布

rohanpaul_ai · x · 2026-08-20

一篇新论文揭示了 RAG 系统面临的安全风险:恶意文档可通过“注意力塌陷”增加模型输出的置信度与一致性,导致基于不确定性的检测失效。攻击下,注意力会集中在被投毒的文档而非广泛证据上。因此,仅检查最终答案或置信度可能无法发现攻击,监控注意力在检索文档间的分布才是关键。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →