Goodfire分享RLFR训练中的探针监测方法

GoodfireAI 介绍了他们在 RLFR 训练中运行解释性探针的严谨做法。为避免模型在扩展训练时学会“躲避监控”,他们选择在冻结的原始模型副本上运行探针,而非直接在学生模型上运行。此举确保了实验设置的有效性,防止监测过程本身对模型结论产生干扰。

2026-07-16 ~ 2026-07-16 · 2 条相关