百万并发沙盒灌 RL:MiMo-Flash 训练量曝光仍不及 V4.1 火候
teortaxesTex · x · 2026-09-23
作者对比认为,尽管跑分与宣传声势大,MiMo-Flash 仍不如 V4.1 Flash 训练得充分,而后者获得了海量 RL 投入——数百万个并发沙盒环境。引用 MiMo 论文数据:采样约 127 万条轨迹(保留 75.2 万条),一次 rollout 对应一个沙盒,rollout 占总时长 44%,V2.6 Flash 一次完整 rollout 约 36 小时。作者估算一个 DSec 单元加 V4.1 可在约 10 小时内完成同等 rollout 量,并好奇若继续「深炸」数周会得到什么。
所属事件:网友推算 MiMo RL 训练轨迹数,称其仍逊于 V4.1(2 条相关)→
「模型」频道最新
- 阿里吴泳铭称 Qwen 取得 RSI 进展,规划 5-10T 参数模型 — teortaxesTex · 2026-09-23
- 给 Opus 5.5 接上创作工具后问它梦见什么,回答很有料 — angrypenguinPNG · 2026-09-23
- Yuchen Jin 实测 Opus 5.5 后判断:前沿模型编码能力已趋平台期 — Yuchenj_UW · 2026-09-23
- Forward Future 用 Opus 5.5 完成 8 项实测:建城、做游戏、动画 — MatthewBerman · 2026-09-23
- Matthew Berman 实测称 Opus 5.5 是全球最强模型 — MatthewBerman · 2026-09-23
- 花 5 美元微调 10 分钟,Qwen3.6 GPQA 涨 8% — simonguozirui · 2026-09-23