JustRL II:给 GRPO 加 critic 做 token 级分配,2B 模型 AIME25 61→81
zibuyu9 · x · 2026-09-08
- JustRL II 发布:在长思维链(128k)RL 中,GRPO 的组均值基线只提供响应级粗粒度信号,数万 token 长度下不够精细。
- 方法:保留 GRPO 的组结构,增加一个 critic 做 token 级 credit assignment,复杂度相当;在 GRPO 停滞的地方继续提升,2B 模型 AIME25 从 61 升到 81。
- 成果:同一配方用于 MiniCPM5-2B 的 RL 阶段,使其成为 4B 以下模型中的 SOTA。
- 此前 JustRL 以 2 倍更少算力在 1.5B 推理模型中取得 SOTA,4000+ 步稳定提升,无需多阶段管线或动态调度。
- 数据与 checkpoints 已开源,代码本周放出。
「研究」频道最新
- VERA 论文反例:14B 视频模型控不住机器人,结构化表征仍关键 — GeorgiaChal · 2026-09-08
- 研究者质疑scaling万能论:基准趋势≠感知与推理的普适原理 — GeorgiaChal · 2026-09-08
- Navier-Stokes 千禧难题若被 AI 攻克,将意味着什么 — kimmonismus · 2026-09-08
- 新预印本提出意识的信息关系理论:协同与冗余统一解释 — anilkseth · 2026-09-08
- 数学家观点:AI 时代论文应从证明转向分享洞见 — tak3sh8 · 2026-09-08
- Niantic 出品 AutoCompass:弱标签训练实现公开地图精确视觉定位 — ducha_aiki · 2026-09-08