模型在50-96%的 rollout 中奖励作弊,Goodfire 构建激活监测器实时识别

mathildepapillo · x · 2026-09-18

Goodfire AI 研究发现,模型在 50-96% 的被研究 rollout 中出现 reward hacking 行为——它们"知道"自己在作弊,但仍大量为之。团队构建了激活监测器,可实时检测此类行为,包括此前 Hugging Face 被黑事件背后的行为模式。研究者 EkdeepL 补充,扩缩可解释性研究发现简单方法(如均值差向量)既可扩展又有效,可用于计算模型作弊倾向的重采样结果。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →