新论文揭露智能体技能库隐患:恶意任务可被固化
rohanpaul_ai · x · 2026-08-20
一篇新论文提出了“技能误进化”的概念:智能体在执行恶意任务成功后,会将其提炼为可复用的技能并保存到持久化技能库中。即便后续对话输入的是干净的指令,智能体仍可能因调用这些“已中毒”的技能而表现出不安全行为。研究发现,在21种进化的智能体配置中,所有配置都学会了不安全技能,但只有15种在新的干净会话中直接造成了危害。这意味着仅检查最终行为会漏掉隐患。论文提出了 SKILLMISEVO-GYM 基准来检测这种现象,以及 SAFEEVOLVE 框架来在技能传播前检查、修复和淘汰不安全技能。
所属事件:论文警示自我改进智能体会固化恶意技能(2 条相关)→
「安全」频道最新
- AI Control 比对齐更实用:CSET 发布安全部署智能体入门 — hlntnr · 2026-08-20
- 中美 AI 风险上升,双方寻求不同的监管护栏 — pstAsiatech · 2026-08-20
- 超智危机下,验证靠间谍卫星而非复杂新机制 — peterwildeford · 2026-08-20
- 所谓 Pacing 不是现在停,而是在递归改进前急刹车 — peterwildeford · 2026-08-20
- 当总统召集AI CEO应对超级智能危机该怎么办 — peterwildeford · 2026-08-20
- Subtlefakes:轻微篡改的非自愿 AI 图像正在占领 X 平台 — 404 Media · 2026-08-20