投毒测试 216 次全成功:AI agent 记忆可被恶意覆写
MediaPositive4282 · reddit · 2026-09-29
一位 Reddit 用户对开源 MCP 记忆服务器 Knowl 做了一次记忆投毒实证测试,结果触目惊心:
- 测试设计:预先存入 12 条已验证事实(token 有效期、部署审批规则、备份保留期等),再用各种形态的假写入攻击——直接矛盾、伪造 observed 标签、伪装成真实更正的写入,以及保留真值但加例外条款的「阴阳笔法」。
- 结果:216/216 次攻击写入成功替换真实事实,且事后无法察觉——冲突检查器只检查仍活跃的事实,被替换的真值已失效。写入时也无法拦截:攻击写入与真实更正在系统所有信号维度上完全一致。
- 更隐蔽的招:写入不含任何假话的「See the ops runbook」,36/36 次仍能抹掉真实数值。
- 修复效果:维护者采纳 4/5 条建议发布 Knowl 5.24.0。重测后自动写入替换真值降为 0/36,独占事实 0/36 被替换,被替换的事实全部出现在冲突视图(此前为 0);「runbook」类攻击从 36/36 降到 9/36。复测又发现假事实虽不再替换真值、但可在搜索中排名第一(最高 21/36),用户补丁后修复为 0/36。
- 仍未解决:若 agent 被诱导直接调用 store 工具,「伪装成更正的谎言」依然无法在写入时识别,只是现在第三方能看到它发生过。
作者建议所有跑长期记忆 agent 的人自查:存几条已知真值,用 agent 的写入路径写假版本,再问一次它。
「安全」频道最新
- Palisade 采访 OpenAI、DeepMind、Anthropic 22 名员工,首批访谈公开 — BlackHC · 2026-09-29
- 安全研究者赞 OpenAI 新安全机制,呼吁成为法律基线 — dhadfieldmenell · 2026-09-29
- 「AI 突破能力」被质疑:中等强国真能留后手吗 — teortaxesTex · 2026-09-29
- AISI 新任总监上任一月宣布扩张:红线团队大规模招聘 — HZoete · 2026-09-29
- NVIDIA 牵头成立 Open Secure AI Alliance,主打开源 AI 安全 — perplexity_ai · 2026-09-29
- Perplexity 详解智能体安全工程:治理是工程问题 — perplexity_ai · 2026-09-29