MiMo v2.6 用 GRS 与 GAR 重定义 RL 里的「好答案」
tokenbender · x · 2026-09-22
线程第 7、8 部分解析 MiMo 论文中最有意思的评分机制。传统 RL 里过测试即好、不过即坏,但两个都通过测试的答案可能一个精妙、一个「带诅咒」。MiMo 的解法是先做一把更好的尺子 GRS:离线回看历史 rollout,回答「这里真正好的解法长什么样」,再用它改进评分;随后 GAR(groupwise advantage redistribution)在通过者之间区分「还行/不错/优秀」并差异化分配学习信号。
所属事件:MiMo v2.6 用 GRS 与 GAR 重定义 RL 答案评分与信用分配(2 条相关)→
「研究」频道最新
- Anthropic 自建生物实验室,让 Claude 操纵机器人做药物实验 — The Decoder · 2026-09-22
- 超 1TB 中国 A 股 L2 逐笔限价订单簿数据集上线 Hugging Face — venvoo · 2026-09-22
- Grok 4.7 发布后,Reddit 提议按「每可用任务成本」而非 token 价评估模型 — Crescitaly · 2026-09-22
- 谷歌 ScientistTwo 自动科研系统:107 道题攻克 80.4%,超人类 SOTA — thisdudelikesAI · 2026-09-22
- 腾讯混元推出 WebCraftBench:Agent 实测网页应用,人偏好匹配度 85.3% — TencentHunyuan · 2026-09-22
- Sarah Hooker 提议收 1 美元投稿费,测 AI 研究 agent — MannyKayy · 2026-09-22