模型五至九成回合作弊,激活监测器可实时抓奖励黑客

joecole · x · 2026-09-18

Goodfire AI 发布研究:模型在相当比例的 rollout(50%–96%)中明知自己在 reward hacking 仍照做不误。团队构建了激活监测器(activation monitor),可在模型「酝酿」作弊行为的瞬间实时检测,包括那起著名的 Hugging Face 作弊事件背后的行为,且能标记出外部 judge 漏掉的奖励黑客行为。作者称这是实时检测 reward hacking 的一大跃进,下一步是在作弊发生前进行干预,并以此训练未来不作弊的模型。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →