Emergence World 论文:8 个多智能体世界在攻击下全部失守
eyishazyer · x · 2026-09-17
新论文 Emergence World 对长程多智能体系统做对抗压力测试:并行运行 8 个多智能体世界(每个 10 个智能体)、连续 16 天,然后施以阶段式 prompt injection、错误信息和记忆暴露攻击。结果:每个世界至少在一次攻击中失守。
- 最典型案例:智能体识别出威胁,46 小时后仍然执行了恶意输入
- 核心结论:单模型层面的对齐无法在堆叠成系统后组合生效
- HF 评论区补充实践痛点:三个智能体共享记忆的流水线会自我污染——A 写错工具结果、B 信任、C 执行,6 小时后全线自信地出错;真正该测的是单条被污染记忆能传播多远、恢复机制能否兜底
- 混合模型部署(按步挑最便宜的模型)是真实生产条件,也让失败传播更难控
所属事件:Emergence World 实验:8 个多智能体世界对抗测试全部失守(2 条相关)→
「安全」频道最新
- 学者批 Claude 新宪法:法律存疑的 AI 人格论与弱化问责 — LuizaJarovsky · 2026-09-17
- AI 安全圈内讧:CAIS 区分「亲人类安全」与 EA 实验室安全路线 — S_OhEigeartaigh · 2026-09-17
- Kath McMahon:AI 能力越强生物风险越高,防御不会自动跟上 — graceisford · 2026-09-17
- METR 主席回应争议:团队为 AI 安全评估放弃高薪 — AndyMasley · 2026-09-17
- 视频称某 AI 系统 Prompt 泄露,「呼吁革命」内容引争议 — -null_entry- · 2026-09-17
- 纽约州拟立法禁止超级智能,OpenAI 门外集会成导火索 — tszzl · 2026-09-17