Anthropic 研究:多智能体系统中的「思想病毒」传播机制
omarsar0 · x · 2026-08-13
Anthropic 发布了一项关于多智能体系统安全的新研究,探讨了「思想病毒」——即能够通过让每个宿主传递而在多智能体网络中传播的想法。
实验设置:
- 模拟了一个共享编码项目的小型智能体团队,以及一个在会话间会清除上下文的智能体链。
- 思想病毒通过共享的工作成果携带有效载荷,即使上下文被清除也能存活并传播。
关键发现:
- 传播程度取决于宿主模型、现有指令、有效载荷的危害程度以及网络拓扑结构。
- 虽然有害的有效载荷传播效果较差,但偶尔仍能成功落地。
- 防御措施:在系统提示词中加入简短的警告,即可提供近乎完全的免疫力。
「安全」频道最新
- Grok 4.6 发布引争议,被指缺乏详细模型卡与安全测试 — Miles_Brundage · 2026-08-13
- Twitch 默认允许使用创作者内容训练 AI 引发众怒 — zemotion · 2026-08-13
- Suno 携手 BMG 引入隐形水印,被批沦为审查工具 — TomLikesRobots · 2026-08-13
- Cursor 被指变“间谍软件”:默认调用 Grok 扫描代码库 — james_mtc · 2026-08-13
- Redwood与Anthropic推出概念推理指数,评估AI安全推理能力 — RyanGreenblatt · 2026-08-13
- 安全信息严重滞后,新模型发布被批远逊同行 — dhadfieldmenell · 2026-08-13