RL训练稳态秘诀:GRPO改造四板斧拆解

tokenbender · x · 2026-09-22

作者分析了该RL训练方案的几个核心改造:坚持用GRPO而非更花哨的算法,但为稳定性和规模做了针对性修改——prompt均值损失替代token均值损失,避免长回答获得过多梯度权重(DAPO);正负优势分别设置裁剪边界(DAPO);熵自适应裁剪(mai-thinking-1);以及分段级信用塑造(TreeAdv)。

作者还观察到13%的策略漂移staleness下仍保持高吞吐,说明所选环境可直接在基础权重上运行或改进,无需课程学习(curriculum)——否则训练会受到明显惩罚。

所属事件:小米 MiMo 百万上下文 RL 训练细节引热议(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →