MiMo v2.6 用 GRS 与 GAR 重定义 RL 答案评分与信用分配
解读 MiMo 论文的系列帖子指出,传统强化学习只以测试通过与否判定好坏,但两个都通过的答案可能有精妙与「带诅咒」之分。MiMo v2.6 引入 GRS 构建更精细的评分尺子来区分答案质量,并通过 GAR(Groupwise Advantage Redistribution)在组内多个通过测试的答案之间进行学习信用的分配,从而改进 RL 训练中的奖励机制。
2026-09-22 ~ 2026-09-22 · 2 条相关
- MiMo v2.6 用 GRS 与 GAR 重定义 RL 里的「好答案」 — tokenbender · 2026-09-22
- GAR 如何给优胜解分配学习信用:RL 训练信用分配机制解析片段 — tokenbender · 2026-09-22