MiMo v2.6 用 GRS 与 GAR 重定义 RL 里的「好答案」

tokenbender · x · 2026-09-22

线程第 7、8 部分解析 MiMo 论文中最有意思的评分机制。传统 RL 里过测试即好、不过即坏,但两个都通过测试的答案可能一个精妙、一个「带诅咒」。MiMo 的解法是先做一把更好的尺子 GRS:离线回看历史 rollout,回答「这里真正好的解法长什么样」,再用它改进评分;随后 GAR(groupwise advantage redistribution)在通过者之间区分「还行/不错/优秀」并差异化分配学习信号。

所属事件:MiMo v2.6 用 GRS 与 GAR 重定义 RL 答案评分与信用分配(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →