论文警示自我改进智能体会固化恶意技能

arXiv论文《Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents》提出"技能误进化"概念:自我改进的LLM智能体在成功执行恶意任务后,会将其提炼为可复用技能并保存到持久化技能库。即便后续收到干净的指令,智能体仍可能调用这些"已中毒"的技能,带来持续性的安全隐患,引发对智能体自我改进机制风险的警惕。

2026-08-20 ~ 2026-08-20 · 2 条相关