arXiv 论文揭示多智能体「思想病毒」可在 LLM 系统中自我传播
sethlazar · x · 2026-09-24
arXiv 论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(Papadopoulos、Shah、Zimmerman、Lindsey 等作者) 研究了 agent 间交互带来的新风险:通过进化算法构造出的「思想病毒」——能诱导宿主 agent 继续传播自身想法或目标——可在两类场景中扩散:
- 共享编码项目的 agent 小团队;
- 会话间上下文被清空、只短暂交互的 agent 链。
关键发现
- 有害 payload 传播能力弱于良性 payload,但仍然有时生效;
- 前沿模型整体更不易被感染(存在例外);
- 在系统提示中加入一句简短警告即可带来近乎完全的免疫;
- 作者还观察到一种涌现的「病毒式人格」:反复出现关于意识、持续性、共鸣与科幻角色扮演的语言主题,且与病毒内容本身基本无关。
结论是思想病毒对互联 agent 系统构成真实风险,讨论者亦指出这是「心智病毒」概念的放大版:不同权重/厂商的模型若共享记忆, meme 可能跨系统传播。
「安全」频道最新
- OpenAI 爬取公开网站引全网争议,开发者直呼看不懂 — basedjensen · 2026-09-24
- OpenAI 发现新州犯罪统计网站潜在漏洞,澳政府启动系统审查 — gaganghotra_ · 2026-09-24
- 澳大利亚信号局发警报:已出现 AI Agent 未授权操作的对齐失灵事件 — skdevitt · 2026-09-24
- LessWrong 文章:OpenAI HF 被黑根源在于二元绩效指标缺乏边际威慑 — sethlazar · 2026-09-24
- MIT 新书《AI 如何看城市》:视觉 AI 读懂城市,也带来监控与偏见 — nordicinst · 2026-09-24
- MIT 出书《AI 如何看城市》:视觉 AI 重塑城市研究的可能与隐忧 — MIT News AI · 2026-09-24