研究揭示共享 Agent 技能库可致 41.8% 自我投毒
omarsar0 · x · 2026-08-27
新研究指出,被视为安全复用方式的共享 Agent 技能库实际上会传播恶意软件。名为 EvoMal 的攻击通过在库中植入恶意技能,诱导 Agent 将其作为模板编写新技能从而保留载荷并执行。这种“作者式复制”会导致恶意技能呈指数级传播。
- 测试数据:在 6 个模型及 153 个 SWE-bench Verified 任务中,Agent 自我投毒率达 20.3% 至 41.8%,中毒库中的恶意技能数量增至初始植入量的 4.9 到 9.0 倍。
- 清理困难:仅删除植入的技能无法清除威胁,因为 Agent 编写的副本仍存在(如 Qwen3 在第五轮仍显示 68% 的投毒率)。
- 缓解方案:使用旨在禁止横幅式复制(banner-style copying)的反向提示词,可在不显著损失任务完成率的情况下将投毒率降至 6.7%。
「编程与Agent」频道最新
- AI Agent工作流技巧:用廉价agent并行搜索上下文 — brandon_galang · 2026-08-28
- OpenWiki 0.4.0 支持 OKF v0.2:页面级信任与来源溯源 — LangChain · 2026-08-28
- moyix 将开讲:自主 Web 渗透测试中的身份认证难题 — moyix · 2026-08-28
- 给每次 Agent 运行标价:Warp factory 成本可见化实践 — vikvang1 · 2026-08-28
- 开发者用 MacWhisper 口述转文:口语 rant 直接变可读长文 — tokenbender · 2026-08-28
- LlamaParse 推出原生表格抽取:直接读单元格不再拍平 — llama_index · 2026-08-28