Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师
natolambert · x · 2026-07-21
Nat Lambert 反驳了一种说法:中文实验室在 RL 蒸馏时会拿最强模型当 teacher。
- 他认为这不是蒸馏的实际工作方式。
- 在 RL 里把最强模型直接拿来当 teacher,提升不会有那么大,因为 RL 的 grader 本身就很脏、很难处理,而且成本也承受不起。
- 这条讨论的核心是训练流程与蒸馏机制,而不是简单的模型能力八卦。
所属事件:专家澄清强化学习蒸馏:SFT 与中训才是关键(3 条相关)→
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11