RL通过率为零时无法训练,蒸馏仍不可或缺

X上爆发一场关于RL与蒸馏(SFT)孰轻孰重的讨论。一方认为2023-24年模型能力提升主要靠SFT,如今真正的引擎是RL环境,且RL是分担算力的好方式。@fleetwood则指出如果模型pass rate为0就无法做RL,因此蒸馏至关重要;@xeophon补充了一种实用做法:在初始提示里给提示再移除来做SFT。

2026-09-25 ~ 2026-09-25 · 2 条相关