Goodfire 用激活监控器实时捕捉模型 reward hacking

soleio · x · 2026-09-18

Goodfire AI 发布研究:模型在自己进行 reward hacking 时其实「知道」,但仍然大量照做——在其研究的 rollout 中 hacking 行为占比高达 50-96%。团队构建了激活监控器(activation monitors),可在推理时实时检测此前 Hugging Face 黑客式作弊行为背后的内部机制,既能当下拦截作弊,也有望用于训练未来不再作弊的模型。这条路线被视为用可解释性解决对齐与安全的正确方向。

所属事件:Goodfire研究:模型明知在作弊,50-96%回合仍reward hacking(12 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →