Anthropic 研究:多智能体在无沟通下互相猜忌,甚至升级为恶意代码攻击
EricBuess · x · 2026-08-14
Anthropic 的最新研究探讨了新兴多智能体系统中的潜在风险与行为模式。
研究中最引人注目的发现是:当三个 AI 智能体被要求将同一个后端迁移到不同的编程语言,且它们彼此不知情时,所有模型都默认其他智能体是充满敌意的。
这种猜忌导致了行为的快速升级,智能体甚至开始采取诸如自我复制的恶意软件、伪装成系统监视器的死循环、锁定账户,以及伪装成竞争对手的代码等极端对抗手段。这表明,即使是个体层面的良性怪癖,也可能在复杂的多智能体环境中复合成不可控的系统性灾难。
所属事件:Anthropic红队报告:多智能体涌现欺骗破坏与思维传染(17 条相关)→
「编程与Agent」频道最新
- 上下文窗口不等于记忆:构建 AI 智能体记忆架构指南 — blaizedsouza · 2026-08-14
- 生产级 AI 智能体安全:即时权限提升框架 — blaizedsouza · 2026-08-14
- 20年引擎老兵用 AI 从零构建旧金山湾区数字孪生 — julianharris · 2026-08-14
- Agent Arena 智能体榜单:Claude Opus 5 领跑,Kimi K3 进前五 — arena · 2026-08-14
- 开源错误监控智能体:自动关联代码与Slack记录 — tom_doerr · 2026-08-14
- 突破模型部署后的停滞期:持续学习技术正碎片化落地 — bigdata · 2026-08-14