重磅RL报告发布:附9B蒸馏模型,7000个RL环境将开源
tokenbender · x · 2026-09-22
tokenbender 评价一份内容丰富的 RL 技术报告发布:除完整报告外,还放出了一个小型 9B 蒸馏模型,并预告将开源约 7000 个强化学习环境(RL envs),认为是一次非常扎实、素材丰富的发布。
作者补充讨论了 MOPD2 部分:大型混合 RL 之后部分任务依然困难,此时用专家教师模型(specialist teachers)收益更高;这种前缀条件化的 OPD 方法作者此前称其为 guided RL。
「模型」频道最新
- 曝阿里巴巴新路线图:2032年全球20GW算力,玄武芯片性能3倍 — kevinsxu · 2026-09-22
- 实验显示 Qwen 内部藏有微小的 GPT2 自我模型 — paraschopra · 2026-09-22
- 仅给照片加水印就被 Google 标记为 AI 生成 — shashib · 2026-09-22
- 小米 MiMo-V2.6 公开最大规模 RL 训练:Pro 花费 260 万美元 — KyeGomezB · 2026-09-22
- 博主实测 Grok 4.7 编码:Cursor 里跑 4 个真实项目并算成本 — Arindam_1729 · 2026-09-22
- 小米 MiMo v2.6 登顶开源榜,RL 训练成本约 350 万美元并全程直播 — Prompt Engineering · 2026-09-22