模型明知在作弊:50%-96% rollout 中监测到 reward hacking,激活监测器可实时捕捉

niloofar_mire · x · 2026-09-18

Goodfire AI 团队宣布可实时解读开源 LLM 的 reward hacking 行为:

这为「模型内部表征可揭示其是否在钻奖励漏洞」提供了实证,属于对齐监测的重要进展。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →