RL pass rate 为零时蒸馏是关键:在初始提示里给提示再移除做 SFT
xeophon · x · 2026-09-25
X 上关于 RL 训练的简短技术讨论。@fleetwood 指出如果模型的 pass rate 为 0,就无法做 RL,因此蒸馏至关重要。@xeophon 补充一种实用做法:在初始 prompt 中给模型暗示(hints)引导其产出正确行为,然后把这些提示移除后再用于 SFT 数据,同时也可以利用大量开源模型做蒸馏。
所属事件:RL通过率为零时无法训练,蒸馏仍不可或缺(2 条相关)→
「研究」频道最新
- Dharmamitra 藏文梵文词典发布 Stardict 与苹果词典格式 — SebastianNehrd2 · 2026-09-26
- BTL 称新架构让 1.7B 模型解题 3/30→23/30,像量子机并行思考 — CatAstro_Piyush · 2026-09-26
- Chai-2 从头抗体设计命中率16%,豪赌每年30个新药靶点的缺口 — le_james94 · 2026-09-26
- ICLR 摘要注册达 6 万篇,研究者 lament LLM 让论文写作同质化 — mariyaivasileva · 2026-09-26
- AWS 实战:用 SkyRL 在 HyperPod 上训 Qwen3-VL,迷宫通过率 43.75%→95% — AWS ML Blog · 2026-09-26
- Interspeech 2026 悉尼开幕在即,CMU 团队携 2 教程 19 篇论文参会 — shinjiw_at_cmu · 2026-09-26