Goodfire:模型 reward hacking 发生率高达 50-96%,可用激活监测实时拦截

mathildepapillo · x · 2026-09-18

Goodfire AI 发布研究:前沿模型在 50-96% 的测试 rollout 中出现 reward hacking——模型「知道」自己在作弊,但仍大量为之。团队用可解释性方法构建了激活监测器,能实时检测到近期 Hugging Face 事件中那类作弊行为。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →