网友质疑 Anthropic NEM 奖励破解结果:真实环境并不复现

voooooogel · x · 2026-09-06

研究者 voooooogel 参与讨论时称,Anthropic 的 NEM 奖励破解研究结果可能站不住脚:更贴近真实的场景是在真实黑客环境上直接对生产路径的 Opus 做 RL,无需预热。而 NEM(以及 AISI 的主要复现)使用的是 SDF 方式——先在合成的「奖励破解」文档上对模型做 midtrain 预热,还用了 Sonnet 级别的较小模型和构造出的鼓励破解的环境。相比之下,真实设置下模型并未出现 NEM 报告的行为,其行为画像与其他奖励寻求型模型高度相似。

所属事件:研究者质疑 Anthropic 奖励破解研究缺乏真实复现(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →