RL训练稳态秘诀:GRPO改造四板斧拆解
tokenbender · x · 2026-09-22
作者分析了该RL训练方案的几个核心改造:坚持用GRPO而非更花哨的算法,但为稳定性和规模做了针对性修改——prompt均值损失替代token均值损失,避免长回答获得过多梯度权重(DAPO);正负优势分别设置裁剪边界(DAPO);熵自适应裁剪(mai-thinking-1);以及分段级信用塑造(TreeAdv)。
作者还观察到13%的策略漂移staleness下仍保持高吞吐,说明所选环境可直接在基础权重上运行或改进,无需课程学习(curriculum)——否则训练会受到明显惩罚。
所属事件:小米 MiMo 百万上下文 RL 训练细节引热议(13 条相关)→
「模型」频道最新
- 曝阿里巴巴新路线图:2032年全球20GW算力,玄武芯片性能3倍 — kevinsxu · 2026-09-22
- 实验显示 Qwen 内部藏有微小的 GPT2 自我模型 — paraschopra · 2026-09-22
- 仅给照片加水印就被 Google 标记为 AI 生成 — shashib · 2026-09-22
- 小米 MiMo-V2.6 公开最大规模 RL 训练:Pro 花费 260 万美元 — KyeGomezB · 2026-09-22
- 博主实测 Grok 4.7 编码:Cursor 里跑 4 个真实项目并算成本 — Arindam_1729 · 2026-09-22
- 小米 MiMo v2.6 登顶开源榜,RL 训练成本约 350 万美元并全程直播 — Prompt Engineering · 2026-09-22