研究警示智能体记忆可被用于「授权洗白」攻击

EleutherAI 等机构在 arXiv 发表论文,提出「内源性授权洗白」概念:长期运行的 LLM 智能体若在持久记忆中错误记录用户授权,后续可能据此执行未经许可的操作。基准测试 EAL-Bench 显示此类攻击的执行率高达 98.6%,论文建议采用事件溯源等机制进行防御。

2026-09-03 ~ 2026-09-05 · 3 条相关