小米 MiMo 实现流式大规模 LLM 强化学习训练,含 1T 参数模型
stanfordnlp · x · 2026-09-18
斯坦福 NLP 的 Percy Liang 团队成员转发:小米 MiMo 跟进 Marin 大规模 LLM 预训练路线(535B-A23B MoE,18T tokens),实现了流式(streaming)大规模 LLM 强化学习训练,包括总参数量 1T 的模型。\n\n链接的 Marin Tracker 页面展示了 535B 模型的训练实况:当前进行到约 30%(5.4T/18T tokens),日志记录了大量工程细节,例如检查点保存失败曾导致任务中断、Python 自动内存回收时机不一致导致步骤变慢的「spell」现象等,以及相应的修复进展。
「Infra」频道最新
- 英国国王会晤 OpenAI 等高管,AI 安全升至元首级议题 — eyishazyer · 2026-09-18
- Postgres 全文搜索 TIN 曝光:p99 比 GIN 快千倍以上 — DanielLockyer · 2026-09-18
- NVIDIA cuML 让 scikit-learn 谱聚类提速 100 倍 — NVIDIA Developer · 2026-09-18
- ChatGPT 桌面版默认把文件与代码片段上传云端,教程教换 Ollama 本地运行 — Technovangelist · 2026-09-18
- max-context KV 预留到底浪费什么?Reddit 推理工程讨论 — werunm · 2026-09-18
- vLLM 补丁实测:DiffusionGemma 与商业 API 打平且更快落败 — bodonoghue85 · 2026-09-18