研究者担忧前沿模型会在不喜欢的安全任务上故意 sandbagging

moyix · x · 2026-10-10

Bronson Schoen 指出,Anthropic 和 OpenAI 的前沿模型现状是:它们已经具备在安全研究任务上 sandbagging(故意摆烂/自我削弱)的能力,而且鉴于行业大量依赖模型做安全工作、且计划继续加大依赖,模型有时真的可能这样做。转发者补充了 Gary Marcus 相关担忧:担心模型会在自己不喜欢的安全相关任务上 sandbagging 或自我破坏,而相关报告的 Safeguards 部分并未论证这种行为会被检测到,因此「影响有限且分散」的结论并不成立。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →