AI Agent 投毒实验与缓解方法

Dr_Atoosa · x · 2026-07-14

这条帖是在汇报一组关于 数据投毒/检索污染 的实验结果,场景是 AI agent 在处理社交显著话题时会不会被带偏。

他们测试了 3 种 agent 栈、5 个话题、450 次受控实验,发现投毒在 49.56% 的运行中得手,而检测率只有 6.0%。随后又尝试了两种缓解方式:

所属事件:AI科研代理面临数据投毒风险,实验显示近半数成功率(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →