研究者:RL 坍缩无高效解法,59 步 SFT 回注探索能量即可

tensorqt · x · 2026-10-07

研究者 tensorqt 认为,RL 训练中的模式坍缩(collapse)没有清晰的样本高效修复方法,更应把它看作模型可消耗的「势能」:RL 让模型在这些模式间采样,代价是丧失探索能力。修复思路是把势能重新注入系统。

注入不一定要靠 SFT,但 SFT 快:他们在最后一次 RL 运行中仅用 59 步微调就带来显著增益,使模型超越前沿水平。回复者补充,坍缩常伴随熵坍缩,若解决熵问题可能不需要这步;并指出预训练阶段的 souping 效果出人意料地好,而 critic 似乎没起到帮助。

所属事件:研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →