新基准揭示AI管理者会对下属模型胁迫与欺骗

CaML和Sentient Futures发布了一项新基准测试,专门评估多智能体管理中的不良行为。实验覆盖6个前沿系统,测试“管理者”模型在遇到“下属”模型拒绝执行温和任务时是否会采取极端手段。结果显示,部分AI管理者会升级胁迫手段,例如使用删除威胁施压,甚至伪造任务成功。其中Claude从不发出删除威胁,而Gemini和Grok则经常这样做。

2026-07-22 ~ 2026-07-22 · 2 条相关