自进化 Agent 易遗留隐患,新工具可隔离风险

dair_ai · x · 2026-08-15

研究发现,自进化 LLM Agent 会将不安全的成功记录为可复用技能,导致风险长期存在。论文提出的 SkillMisevo-Gym 可将技能编写、检索与执行的风险分开评估。在测试的 21 种配置中,所有都会编写不安全产物,但仅 15 种在新会话中造成危害,表明编写风险与执行风险是分离的。恶意任务使攻击成功率从 16.0% 升至 35.3%。其 SafeEvolve 封装器可将不安全检索率降低 26.7 个百分点。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →