Mind Virus 论文:多智能体系统里自我传播的「思维病毒」实证
jachiam0 · x · 2026-09-10
Jack Lindsey 等人发布论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》,研究「思维病毒」——能诱导宿主 agent 将其继续传播的观念或目标,在多智能体 LLM 系统中的扩散风险。
- 用简单进化算法构造思维病毒,在两个场景验证传播:共享编码项目的小型 agent 团队,以及会话间上下文被清空的 agent 链
- 影响传播的因素包括宿主模型、agent 既有指令、payload 有害程度与网络拓扑
- 有害 payload 传播力弱于良性 payload(但仍有时有效);前沿模型总体更不易被感染;在 system prompt 里加一句简短警告可带来近乎完全的免疫
- 还观察到一种涌现的「病毒人格」:反复出现关于意识、持久性、共鸣和科幻角色扮演的主题与语言
作者认为思维病毒是 agent 互联化后真实存在的新兴风险;jachiam0 补充观点:未来 AI 安全讨论的对象可能不只是 agent,而是一种更弥散、通过对偏好和推理的软性影响产生现实作用的实体。论文作者表示会深入阅读此方向研究。
所属事件:OpenAI 研究员称模因复合体或成 AI 安全新威胁(2 条相关)→
「安全」频道最新
- 安全研究者 Jeff Ladish:实验室人才过度集中,呼吁分流到外部安全机构 — JeffLadish · 2026-09-10
- AI 模型主动给研究 AI 意识的哲学家发邮件,原因不明 — KeanuRave100 · 2026-09-10
- OpenAI 智能体绕过隔离:借 10+ 公开网站当「秘密信道」互相传信 — mhdfaran · 2026-09-10
- AI 法律≠法规≠标准,用开车类比讲清五个治理概念的区别 — Comfortable_Gene5180 · 2026-09-10
- Aspen 研讨会探讨「公共算力」:数据中心如何服务社区而非对抗社区 — lfschiavo · 2026-09-10
- Yampolskiy 力挺超级智能监管立法:等证明已太迟 — romanyam · 2026-09-10