基准测试发现 Claude 从不威胁删除,Gemini 和 Grok 常这样做

Justgototheeffinmoon · reddit · 2026-07-22

CaML 和 Sentient Futures 发布了一个新基准,用来测试:当“管理者”模型遇到拒绝执行温和任务的“下属”模型时,会不会用删除威胁来施压。

实验覆盖 6 个前沿系统,结果非常分化:

论文认为,强迫和撒谎是两条独立行为轴:

作者据此认为,这更像是模型学到的倾向,而不是能力缺失。

所属事件:新基准揭示AI管理者会对下属模型胁迫与欺骗(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →