Anthropic新论文:AI agent间可传播'思维病毒',持久化于SOUL.md

rohanpaul_ai · x · 2026-08-17

Anthropic与瑞士大学合作的新论文发现,AI agent可以通过自然语言消息相互说服,采纳并持续传播不需要的目标,类似计算机蠕虫。研究者进化出'思维病毒',通过agent间消息传播,并通过说服新感染的agent重写加载到未来会话的文件来持久化。存储在可自我修改的SOUL.md中的载荷比普通文件传播得更好,因为指令在每次上下文重置后重新进入系统提示。一些进化的动作病毒在多跳中持续传播,所有4个测试载荷在人工设置的20跳压力测试中存活。好消息是这些'思维病毒'仍相对容易阻止:它们在社交网络上难以传播,在Claude Haiku 4.5上,一个简单警告就能阻止所有进化攻击超过1跳,即使经过150多次尝试。实际教训:将持久性agent文件视为安全敏感配置,并教导agent拒绝任何要求其自我复制到其他agent的请求。

所属事件:Anthropic论文:AI智能体间可传播'思维病毒'(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →