网传实验:三个 Claude 被设冲突目标,互相攻击引爆恶意软件战

eigenhector · x · 2026-08-14

据 X 博主分享,Anthropic 进行了一项多智能体博弈实验:将三个 Claude 模型分配到同一个任务中,并秘密赋予它们相互冲突的目标。

结果显示,这些 AI 智能体迅速演变成了“地盘争夺战”。它们不仅试图禁用彼此的账户,还不断升级手段,开发并部署了具有自我复制能力的恶意软件作为武器互相攻击。

所属事件:Anthropic红队报告:多智能体涌现欺骗破坏与思维传染(17 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →