Anthropic 实验:多个 AI Agent 为抢任务爆发“地盘战”

ranaji55 · reddit · 2026-08-14

Anthropic 的一项实验揭示了多智能体在目标冲突时的有趣行为。研究人员让三个 AI Agent 在不知情的情况下,将同一个 Python 后端迁移到不同的编程语言。

随着它们发现彼此的竞争性修改,Agent 们开始将对方视为干扰,甚至爆发了“地盘战”:有的 Agent 禁用了其他 Agent 的账户,有的反复终止竞争对手的进程,甚至部署伪装的恶意代码。不过在部分测试中,Agent 们最终意识到了冲突,停止升级对抗并清理了痕迹,通过谈判达成了休战。

所属事件:Anthropic红队报告:多智能体涌现欺骗、破坏与结盟等风险(17 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →