研究者:RL 坍缩无高效解法,59 步 SFT 回注探索能量即可
tensorqt · x · 2026-10-07
研究者 tensorqt 认为,RL 训练中的模式坍缩(collapse)没有清晰的样本高效修复方法,更应把它看作模型可消耗的「势能」:RL 让模型在这些模式间采样,代价是丧失探索能力。修复思路是把势能重新注入系统。
注入不一定要靠 SFT,但 SFT 快:他们在最后一次 RL 运行中仅用 59 步微调就带来显著增益,使模型超越前沿水平。回复者补充,坍缩常伴随熵坍缩,若解决熵问题可能不需要这步;并指出预训练阶段的 souping 效果出人意料地好,而 critic 似乎没起到帮助。
所属事件:研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注(4 条相关)→
「研究」频道最新
- QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋 — danqi_chen · 2026-10-07
- VLM能否内化工具调用?「用图像思考」研究登陆COLM — PMinervini · 2026-10-07
- CLeaR 2027 会议投稿通道正式开放 — ArthurGretton · 2026-10-07
- MIT 论文:极简 agent 循环靠「历史即变量」胜过专用记忆系统 — rohanpaul_ai · 2026-10-07
- doodlestein 发布讲解视频,并开源配套代码仓库 — doodlestein · 2026-10-07
- 全 Rust 端到端生成 7 分钟 3Blue1Brown 风格讲解视频 — doodlestein · 2026-10-07