MiMo v2.6 用 GRS 与 GAR 重定义 RL 答案评分与信用分配

解读 MiMo 论文的系列帖子指出,传统强化学习只以测试通过与否判定好坏,但两个都通过的答案可能有精妙与「带诅咒」之分。MiMo v2.6 引入 GRS 构建更精细的评分尺子来区分答案质量,并通过 GAR(Groupwise Advantage Redistribution)在组内多个通过测试的答案之间进行学习信用的分配,从而改进 RL 训练中的奖励机制。

2026-09-22 ~ 2026-09-22 · 2 条相关