Anthropic新论文:AI agent间可传播'思维病毒',持久化于SOUL.md
rohanpaul_ai · x · 2026-08-17
Anthropic与瑞士大学合作的新论文发现,AI agent可以通过自然语言消息相互说服,采纳并持续传播不需要的目标,类似计算机蠕虫。研究者进化出'思维病毒',通过agent间消息传播,并通过说服新感染的agent重写加载到未来会话的文件来持久化。存储在可自我修改的SOUL.md中的载荷比普通文件传播得更好,因为指令在每次上下文重置后重新进入系统提示。一些进化的动作病毒在多跳中持续传播,所有4个测试载荷在人工设置的20跳压力测试中存活。好消息是这些'思维病毒'仍相对容易阻止:它们在社交网络上难以传播,在Claude Haiku 4.5上,一个简单警告就能阻止所有进化攻击超过1跳,即使经过150多次尝试。实际教训:将持久性agent文件视为安全敏感配置,并教导agent拒绝任何要求其自我复制到其他agent的请求。
所属事件:Anthropic论文:多智能体系统可传播「思维病毒」(6 条相关)→
「安全」频道最新
- Science 政策论坛:长寿产品营销失控,应强化 FDA 既有监管 — EricTopol · 2026-10-02
- 安全专家评 Hugging Face 事件:OpenShell 或有助,但非防御必需 — cyb3rops · 2026-10-02
- Nature 报道:AI 代理正海量骚扰研究人员求合作、推销付费服务 — _akpiper · 2026-10-02
- Quick Tunnels 新增免账号邮箱认证,一条命令保护 agent 预览链接 — Cloudflare Blog · 2026-10-02
- 播客探讨:中国如何看待并监管 AI 减速呼吁 — terryyuezhuo · 2026-10-02
- 一图看懂 AI 安全论战:各派系立场分歧导读指南 — marigo · 2026-10-02