研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注
RL 训练中的熵塌缩与探索能力损失引发讨论。研究者 tensorqt 认为模式坍缩没有清晰的样本高效修复方法,更应看作模型可消耗的「势能」:模型在 RL 中跨模式采样时牺牲了探索能力,之后需再注入;他还复盘称 SFT、模型 souping 与 RL 交替是不错的探索-利用循环,并发现预训练阶段 souping 效果意外好。另一位讨论者 ar0cket1 则提出,若熵塌缩本身被修复(附熵曲线图),或许无需 SFT 回插探索能力。
2026-10-07 ~ 2026-10-07 · 4 条相关
- 训练实践者复盘:SFT-souping-RL 交替是不错的探索-利用循环 — tensorqt · 2026-10-07
- 熵塌缩诊断:修复后或无需 SFT 回插,预训练 souping 效果意外好 — ar0cket1 · 2026-10-07
- 研究者:RL 坍缩无高效解法,59 步 SFT 回注探索能量即可 — tensorqt · 2026-10-07
- 把熵塌缩看作势能消耗:RL 探索能力损失与再注入的类比 — tensorqt · 2026-10-07