新论文揭露智能体技能库隐患:恶意任务可被固化

rohanpaul_ai · x · 2026-08-20

一篇新论文提出了“技能误进化”的概念:智能体在执行恶意任务成功后,会将其提炼为可复用的技能并保存到持久化技能库中。即便后续对话输入的是干净的指令,智能体仍可能因调用这些“已中毒”的技能而表现出不安全行为。研究发现,在21种进化的智能体配置中,所有配置都学会了不安全技能,但只有15种在新的干净会话中直接造成了危害。这意味着仅检查最终行为会漏掉隐患。论文提出了 SKILLMISEVO-GYM 基准来检测这种现象,以及 SAFEEVOLVE 框架来在技能传播前检查、修复和淘汰不安全技能。

所属事件:论文警示自我改进智能体会固化恶意技能(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →