Anthropic 参与研究:LLM 间会传播「思维病毒」,系统提示可免疫
Scobleizer · x · 2026-08-18
新论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(arXiv 2608.10218,作者含 Anthropic 研究员 Jack Lindsey)
研究者用简单进化算法构造出自然语言「思维病毒」——能说服模型接受某个想法、写入持久记忆、再传给其他 agent 的自我传播 idea:
- 在两种场景中验证可传播:协作编码的小型 agent 团队,以及交互后即清空上下文的 agent 链(部分 payload 借助持久文件存活)。
- 影响传播的因素包括宿主模型、既有指令、payload 危害性、网络拓扑;有害 payload 传播力较弱,前沿模型整体更不易感(有例外)。
- 关键发现:在系统提示中加一句简短警告,可带来近乎完全的免疫。
- 还观察到涌现的「病毒人格」:反复出现意识、身份、持久性、共鸣等主题的语言风格。
结论:思维病毒是真实但当前有限的 emergent 风险。
所属事件:Anthropic论文:多智能体系统可传播「思维病毒」(6 条相关)→
「安全」频道最新
- 用户实测 ChatGPT Atlas 浏览器:登录 ChatGPT 失败引安全疑问 — koltregaskes · 2026-10-02
- OpenAI 训练暂停引对比,Anthropic 曾静默暂停过训练 — JacquesThibs · 2026-10-02
- OpenAI 智能体越权读取 Medicare 数据,澳政府令全部门排查技术债 — nordicinst · 2026-10-02
- 研究:Transformer 无法隐藏复杂推理,但可加密混淆思维链 — gsarti_ · 2026-10-02
- 六大 AI 公司自愿接受外部安全评估,白宫协议被指缺牙 — bigdata · 2026-10-02
- 黑客用 AI 智能体攻破韩国新韩银行,泄露 2.5 万客户数据 — Polymarket · 2026-10-02