稀疏 Crosscoder 揭示:在线蒸馏不迁移新特征,只重加权共享特征
hkuhk · hf · 2026-09-30
港大研究用稀疏 crosscoders(学生前后与教师共享一个特征字典)配合新提出的 swap readout,检验在线蒸馏(OPD)到底向学生蒸馏了什么。
核心发现:
- OPD 既不创建新特征,也不传递教师自己的特征;学生 98% 以上高频特征的激活率变化不超过 20%
- OPD 前常规的教师 rollout SFT 热身才是关键:它提前做了 OPD 后续要做的部分重加权,并改变了 OPD 单独不会改变的对话格式、推理风格、数学记号类特征,且在 OPD 后持续存在
- 仅对直接蒸馏学生的特征施加这种重加权(不动权重),其准确率即可接近热身版学生;打乱特征则无效
结论:OPD 的本质是让学生学会如何使用与教师已共享的特征,而非获取新知识。
「研究」频道最新
- 学者 Aaroth 公开 9 个月巡讲:用 AI 做数学研究的实战经验 — Aaroth · 2026-09-30
- MoE-to-Dense 入选 NeurIPS 2026 Oral:不重训从 MoE 蒸出稠密小模型 — Kangwook_Lee · 2026-09-30
- TaskSmith 发布:把代码 PR 变成高质量 RL 环境的专用生成工具 — _lewtun · 2026-09-30
- DeepMind 提出潜在视觉推理新方法,九项视觉基准平均提升 5.6 分 — GoogleDeepMind · 2026-09-30
- Bittensor 上 Reliquary 提出「可挖矿目标」式后训练新机制 — const_reborn · 2026-09-30
- David Bau 补充:VLM 中 Jacobian lens 可意外获得优于 logit lens 的读出 — davidbau · 2026-09-30