小米直播模型训练:每秒烧 10 美元,估算动用 6000-8000 张 H100
karminski3 · x · 2026-09-17
博主 karminski3 分析小米正在直播的模型训练过程,推测 MiMo-v2.6-pro 与 flash 两模型已进入 Agentic RL 后训练阶段,评估集为 DeepSWE(Pro 得分 62,对比 DeepSeek-v4.1-flash 的 74.2,尚处早期)。
他的推算过程:
- 阶段 10 耗时 58 分钟生成 22 亿 token,即每秒约 63 万 token;平均上下文长 89K
- 按 H100 单卡 100-150 tps 估算,Pro 解码需 4000-5000 张,flash 另需 2000-2500 张,总计约 6000-8000 张 H100
- timing 数据(生成 58 分 + 反传 64 分 ≈ 单步 126 分)表明同一批 GPU 先做 Rollout 推理、打分后立即切换做长序列反向传播
- Pro/Flash 分别维持 23,180 / 37,786 个活跃沙箱,共超 6 万个 Linux/Docker 沙箱并发跑代码——解释了每秒约 10 美元的烧钱速度
所属事件:小米直播模型训练:每秒烧 10 美元,疑用数千张 H100(2 条相关)→
「Infra」频道最新
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17
- 推理并发越低模型越聪明?聊聊量化与GEMV的玄学猜想 — karminski3 · 2026-09-17
- 孟菲斯大学研究:xAI Colossus 1 运营一年周边空气未见明显恶化 — TinfoilTricorn · 2026-09-17
- Beam 上线半年即每 30 分钟处理约 1TB 带宽流量 — markjeffrey · 2026-09-17
- VC-Attention 免训练低比特注意力:B200 上提速 1.6 倍,超越 FlashAttention-4 — xiuyu_l · 2026-09-17
- mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标 — HankYeomans · 2026-09-17