专家澄清强化学习蒸馏:SFT 与中训才是关键
针对业界关于中国实验室在强化学习(RL)蒸馏中直接使用最强模型作为教师模型的传闻,Nat Lambert 发文反驳。他指出,这并非蒸馏的实际运作方式,直接在 RL 中借用强模型并不能产生神奇效果。他强调,蒸馏真正发挥核心作用的阶段是在监督微调(SFT)和中期训练(midtraining)期间,这才是提升模型性能的关键环节。
2026-07-21 ~ 2026-07-22 · 3 条相关
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21
- Nat Lambert 认为蒸馏主要在 SFT 和中训阶段起作用 — natolambert · 2026-07-22
- 蒸馏有用,但真正起作用的是 SFT 和 midtraining — danielrock · 2026-07-22