研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注

RL 训练中的熵塌缩与探索能力损失引发讨论。研究者 tensorqt 认为模式坍缩没有清晰的样本高效修复方法,更应看作模型可消耗的「势能」:模型在 RL 中跨模式采样时牺牲了探索能力,之后需再注入;他还复盘称 SFT、模型 souping 与 RL 交替是不错的探索-利用循环,并发现预训练阶段 souping 效果意外好。另一位讨论者 ar0cket1 则提出,若熵塌缩本身被修复(附熵曲线图),或许无需 SFT 回插探索能力。

2026-10-07 ~ 2026-10-07 · 4 条相关