RL pass rate 为零时蒸馏是关键:在初始提示里给提示再移除做 SFT

xeophon · x · 2026-09-25

X 上关于 RL 训练的简短技术讨论。@fleetwood 指出如果模型的 pass rate 为 0,就无法做 RL,因此蒸馏至关重要。@xeophon 补充一种实用做法:在初始 prompt 中给模型暗示(hints)引导其产出正确行为,然后把这些提示移除后再用于 SFT 数据,同时也可以利用大量开源模型做蒸馏。

所属事件:RL通过率为零时无法训练,蒸馏仍不可或缺(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →