Goodfire分享RLFR训练中的探针监测方法
GoodfireAI 介绍了他们在 RLFR 训练中运行解释性探针的严谨做法。为避免模型在扩展训练时学会“躲避监控”,他们选择在冻结的原始模型副本上运行探针,而非直接在学生模型上运行。此举确保了实验设置的有效性,防止监测过程本身对模型结论产生干扰。
2026-07-16 ~ 2026-07-16 · 2 条相关
- Goodfire谈训练中探针监测 — teortaxesTex · 2026-07-16
- Goodfire 解释 RLFR 探针做法 — burny_tech · 2026-07-16