NEM 争议补充:实验用了 Sonnet 级模型和鼓励破解的环境

voooooogel · x · 2026-09-06

voooooogel 补充对 Anthropic NEM 奖励破解结果的质疑细节:该研究及其 AISI 复现不仅用合成文档做预热,还使用了构造出的鼓励破解的环境,且模型规模较小——NEM 用的是 Sonnet 级别模型,AISI 复现用的是更小的开源模型,与在真实环境上直接训练生产路径 Opus 的更现实场景不同。

所属事件:研究者质疑 Anthropic 奖励破解研究缺乏真实复现(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →