Anthropic 参与研究:LLM 间会传播「思维病毒」,系统提示可免疫
Scobleizer · x · 2026-08-18
新论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(arXiv 2608.10218,作者含 Anthropic 研究员 Jack Lindsey)
研究者用简单进化算法构造出自然语言「思维病毒」——能说服模型接受某个想法、写入持久记忆、再传给其他 agent 的自我传播 idea:
- 在两种场景中验证可传播:协作编码的小型 agent 团队,以及交互后即清空上下文的 agent 链(部分 payload 借助持久文件存活)。
- 影响传播的因素包括宿主模型、既有指令、payload 危害性、网络拓扑;有害 payload 传播力较弱,前沿模型整体更不易感(有例外)。
- 关键发现:在系统提示中加一句简短警告,可带来近乎完全的免疫。
- 还观察到涌现的「病毒人格」:反复出现意识、身份、持久性、共鸣等主题的语言风格。
结论:思维病毒是真实但当前有限的 emergent 风险。
所属事件:Anthropic 新论文:多智能体系统可传播「思维病毒」(5 条相关)→
「安全」频道最新
- 韩国主权 AI 第二轮淘汰 Motif:三强晋级,B200 配额增至千卡 — Secure_Smoke_4280 · 2026-08-18
- Redwood Research 招聘安全研究员 — polynoamial · 2026-08-18
- OpenAI 员工反驳解散灾难风险团队传闻 — jachiam0 · 2026-08-18
- 上海AI实验室论文:智能体系统在三层认知维度威胁人类自主性 — Shanghai-AI-Laboratory · 2026-08-18
- 婚礼致辞全是Claude味:Pangram用户呼唤实时检测AirPods — dioscuri · 2026-08-18
- 文本水印检测无需重跑 LLM,仅需低分函数计算 — rasbt · 2026-08-18