蒸馏有用,但真正起作用的是 SFT 和 midtraining

danielrock · x · 2026-07-22

这条转发在讨论蒸馏(distillation)并不是通往前沿模型的捷径。被引内容强调,蒸馏真正更有价值的环节往往出现在 SFT 和 midtraining 阶段,因为这些阶段更适合把推理行为和某些“思维特征”种进去,而不是简单复制轨迹就能一步到位。

文中还提到,Anthropic 曾表示 DeepSeek 等模型可能在一个 RL 风格的数据管线里使用过其模型,但样本量很小,更像是用于初始化内部模型或做小规模实验,而不是带来决定性的性能跃升。整体观点是:“像 Claude”不等于获得了通往前沿能力的快捷方式。

所属事件:专家澄清强化学习蒸馏:SFT 与中训才是关键(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →