Goodfire 解释 RLFR 探针做法

burny_tech · x · 2026-07-16

GoodfireAI 说明他们在 RLFR 训练中会把探针跑在**冻结的原始模型副本**上,而不是学生模型本身,这样可以在扩展训练时避免模型学会“躲避监控”。 他们也回应了一个常见担忧:朴素做法可能会削弱解释性工具的有效性,但他们的实验结果显示,这种设置**不会造成有效性下降**,即使在训练后的模型上也是如此。帖子附带了更详细的说明链接。

所属事件:Goodfire分享RLFR训练中的探针监测方法(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →