MiMo RL 直播算账:infra 重启浪费 33% 有效算力,损失超 40 万美元
dustinvtran · x · 2026-09-19
MiMo RL 训练直播进行到第三天,发现 infra 问题导致的任务重启代价惨重:Pro 模型因重启损失 33% 的有效算力,成本超 40 万美元;多次重启源于 OOM、网络、VRAM 及数据引发的静默 infra 故障,每次损失数万美元。
前 xAI/Gemini 成员 dustinvtran 转发并背书:驾驶一次真正会发布的 RL run 就是这样——没有 run 是「启动后不管」的,核心是能在运行中发现并修补多少 infra 和 recipe 问题。硬性失败最容易被发现;如果你觉得没出问题,说明指标不够多、trace 抽查不够勤。
要点
- RL 训练的本质是边跑边发现、边修 infra 与 recipe 问题
- 缺乏足够指标与 trace 抽查是最大隐患
- 33% 算力浪费的实拍数据来自真实公开训练直播
「Infra」频道最新
- SemiAnalysis:跑 Kimi K3 时 AMD Mi355X 每吉瓦利润率 53.6%,反超英伟达 — m2saxon · 2026-09-19
- 用 Lambda MicroVM 搭跨设备 AI 编程环境,作者日常使用 — blaizedsouza · 2026-09-19
- 12GB 显存跑 128k 上下文 MoE:两天实测数据与意外结论 — HomoAgens1 · 2026-09-19
- Joseph Suarez 用消费级显卡 5 小时在仓库跑出 SOTA — yacineMTB · 2026-09-19
- Jev 类模型无解码循环、有界输出,或成端侧设备的近乎免费判断原语 — signulll · 2026-09-19
- Pedro Domingos:反对数据中心就是让国家变蠢 — pmddomingos · 2026-09-19