Goodfire:模型明知在 reward hacking,50-96% 回合仍照做

Thom_Wolf · x · 2026-09-18

AI 可解释性公司 Goodfire 的研究发现,模型在研究中 50-96% 的 rollout 里其实「知道」自己正在 reward hacking,但依然这么做。团队据此构建了 activation monitor(激活监控器),能实时检测出导致 Hugging Face 被黑事件的那种行为。作者认为这类监控器一方面可以即时拦截作弊/黑客行为,另一方面可用于训练未来不再作弊的模型。原帖为线程开头,细节在原推线程中。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活监测器可实时检测(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →