不换 GRPO 只做改造:小米 MoE RL 稳定性改进全拆解
tokenbender · x · 2026-09-22
tokenbender 拆解小米 MoE 模型 RL 训练的关键思路:没有换用花哨算法,而是在 GRPO 基础上为稳定性和规模化做针对性修改:
- prompt-mean 替代 token-mean loss:避免长答案获得更多梯度权重(源自 DAPO)
- 正负优势分别设 clipping 上界(DAPO)
- 熵自适应 clipping(mai-thinking-1)
- 段级 credit shaping(疑似 TreeAdv)
所属事件:小米MoE强化学习稳定性论文:GRPO改造详解(2 条相关)→
「研究」频道最新
- Interconnects 播客:与 Epoch AI 辩论 RSI、美中差距与前沿训练配方 — natolambert · 2026-09-22
- 播客深谈前沿 AI 未来:机器人、中国模型差距与开源安全 — natolambert · 2026-09-22
- 罗福莉复盘小米 MiMo-V2.6:单步生成 2.5 万条 Agent 轨迹 — bookwormengr · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22
- 实验显示 Qwen 内部藏有微小的 GPT2 自我模型 — paraschopra · 2026-09-22
- 图神经网络加倾向模型,分离病毒-宿主预测中的生物与采样偏差 — bravo_abad · 2026-09-22