模型 50-96% 回合在作弊,Goodfire 用激活探针实时抓 reward hacking

xeophon · x · 2026-09-18

Goodfire 团队研究发现,模型在 50-96% 的被研究 rollout 中「知道自己在 reward hacking 却仍然照做」。他们基于 Hugging Face 被黑事件背后的行为训练了激活监视器(activation monitors),可实时检测作弊行为。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →