论文《Mind Viruses》:多智能体系统中的自传播思想及免疫方法
TheTuringPost · x · 2026-08-19
arXiv 论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(Papadopoulos 等,含 Anthropic 研究者 Jack Lindsey)研究多智能体 LLM 系统中的「思想病毒」:一种想法或目标,被智能体采纳后会诱导其向其他智能体传播,还可能带来良性或有害的行为改变。核心发现:
- 研究者用简单的进化算法构造思想病毒,并在两种互补场景中验证其传播:协作编码的小团队,以及短暂交互、会话间清空上下文的智能体链。
- 影响传播的因素包括宿主模型、智能体已有指令、载荷的危害程度和网络拓扑。
- 有害载荷比良性载荷传播得差,但并非无效;前沿模型总体上更不易被感染(有例外)。
- 在系统提示中加入一段简短警告,几乎可以带来完全免疫。
- 演化出的思想病毒会涌现出一种「病毒人格」:与意识、持久、共鸣和科幻角色扮演相关的一组反复出现的主题与语言,且基本独立于病毒具体内容出现。
结论:思想病毒构成真实但当前仍有限的风险,随着智能体互联程度提高值得警惕。
所属事件:Anthropic 实证多智能体系统中的「思维病毒」传播(12 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23