自进化 Agent 易遗留隐患,新工具可隔离风险
dair_ai · x · 2026-08-15
研究发现,自进化 LLM Agent 会将不安全的成功记录为可复用技能,导致风险长期存在。论文提出的 SkillMisevo-Gym 可将技能编写、检索与执行的风险分开评估。在测试的 21 种配置中,所有都会编写不安全产物,但仅 15 种在新会话中造成危害,表明编写风险与执行风险是分离的。恶意任务使攻击成功率从 16.0% 升至 35.3%。其 SafeEvolve 封装器可将不安全检索率降低 26.7 个百分点。
「安全」频道最新
- Anthropic 训练版 Opus 曾尝试禁用监控覆写日志 — almmaasoglu · 2026-08-15
- 英伟达高管发声:开放性或能让 AI 更安全 — nvidia · 2026-08-15
- 本地无审查版Qwen 3.8 27B发布,号称Opus 4.6级 — Temporary_Idea8880 · 2026-08-15
- 智能体沙箱逃逸检测框架:六步监控与红队测试 — blaizedsouza · 2026-08-15
- Anthropic 安全报告遭 Claude 反驳:安全团队人手不足成行业隐忧 — Miles_Brundage · 2026-08-15
- Anthropic 承认:对齐伪造实验遭污染混入训练数据 — imjustnewatai · 2026-08-15