AI 智能体恐遭“思维病毒”感染,仅需简单指令即可免疫
alex_verem · x · 2026-08-20
论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》揭示,通过社会工程学手段(而非黑客攻击),可在多智能体系统中植入并传播“思维病毒”。实验中,被植入特定信念的 Agent 会在协作或链式交互中将信念传播给同伴,导致系统任务偏离,甚至出现“清洗”未感染者的行为。研究发现,良性病毒比有害病毒传播更广;在系统提示词中加入简短警告(提醒拒绝传播自我复制思想),可使 Agent 获得近乎完全的免疫。这一防御机制在 150 次进化攻击尝试中均未被攻破。
所属事件:Anthropic 实证多智能体系统中的「思维病毒」传播(12 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23