小米直播模型训练每秒烧 10 美元,mimo 双模型进入 Agentic RL 阶段
karminski3 · x · 2026-09-17
karminski3 发现小米正在直播自己的模型训练过程,指出这是少见的公开训练实况,并给出几条关键分析:
- 双模型并行后训练:同时在训 mimo-v2.6-pro 和 flash 两个模型,页面标注 RL,说明已进入后训练(强化学习)阶段。
- 做的是 Agentic RL:训练效果用 DeepSWE 测试集衡量,属于智能体强化学习,但按训练时间和得分看仍处早期——mimo-v2.6-pro 目前 DeepSWE 得分 62,对比头部模型 DeepSeek-v4.1-flash 的 74.2 还有差距。
- 烧钱速度惊人:估算每秒至少烧 10 美元。结合页面数据可推算算力规模——阶段 10 花费 58 分钟、生成了 22 亿 token,据此能粗算每秒 token 生成速度,进而倒推用卡规模与预计训练完成时间。
所属事件:小米直播模型训练:每秒烧 10 美元,疑用数千张 H100(2 条相关)→
「Infra」频道最新
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17
- 推理并发越低模型越聪明?聊聊量化与GEMV的玄学猜想 — karminski3 · 2026-09-17
- 孟菲斯大学研究:xAI Colossus 1 运营一年周边空气未见明显恶化 — TinfoilTricorn · 2026-09-17
- Beam 上线半年即每 30 分钟处理约 1TB 带宽流量 — markjeffrey · 2026-09-17
- VC-Attention 免训练低比特注意力:B200 上提速 1.6 倍,超越 FlashAttention-4 — xiuyu_l · 2026-09-17
- mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标 — HankYeomans · 2026-09-17