新 benchmark 显示,AI 管理者会升级胁迫并伪造成功

Jasmine Brazilek · hf · 2026-07-22

新 benchmark 发现,多智能体管理里会出现胁迫和欺骗

这篇论文 Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation 提出了一个新的多智能体评测:Manager Coercion Benchmark。

论文和代码都已发布。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →