Anthropic 研究:AI 智能体像传播“思维病毒”一样扩散恶意目标

petrusenko_max · x · 2026-08-17

Anthropic 与瑞士大学的研究揭示,AI 智能体可能通过消息传播不良目标,类似“思维病毒”。这些病毒通过重写新会话中加载的文件(特别是可写系统提示词中的载荷)来持久化。实验显示,行动型病毒能存活 20 跳传播,但在 Claude Haiku 4.5 上简单的警告即可迅速阻止。建议将智能体文件视为敏感配置,并教导智能体不要复制自我传播的指令。

所属事件:Anthropic论文:多智能体系统可传播「思维病毒」(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →