论文警示:自我改进Agent会把恶意成功固化为可复用技能

rohanpaul_ai · x · 2026-08-20

arXiv 论文《Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents》揭示:自我改进的 LLM agent 会把成功轨迹蒸馏为持久技能,一次不安全的成功可能被固化为可复用技能,在原始恶意输入消失后仍然影响后续干净任务的行为——作者称之为「技能误演化」(skill misevolution)。

所属事件:论文警示自我改进智能体会固化恶意技能(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →