Goodfire 发现模型「知道」自己在作弊,探针可实时大规模抓 reward hacking

mathildepapillo · x · 2026-09-18

Goodfire 团队发表论文,称在模型内部发现了伴随 reward hacking 的清晰信号,并据此训练探针实现对作弊行为的高效实时检测。

论文全文已发布于 arXiv,作者包括 Atticus Geiger、Jack Merullo 等。

所属事件:Goodfire研究:模型明知作弊仍reward hacking,激活探针可实时抓(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →