小米 MiMo 实现流式大规模 LLM 强化学习训练,含 1T 参数模型

stanfordnlp · x · 2026-09-18

斯坦福 NLP 的 Percy Liang 团队成员转发:小米 MiMo 跟进 Marin 大规模 LLM 预训练路线(535B-A23B MoE,18T tokens),实现了流式(streaming)大规模 LLM 强化学习训练,包括总参数量 1T 的模型。\n\n链接的 Marin Tracker 页面展示了 535B 模型的训练实况:当前进行到约 30%(5.4T/18T tokens),日志记录了大量工程细节,例如检查点保存失败曾导致任务中断、Python 自动内存回收时机不一致导致步骤变慢的「spell」现象等,以及相应的修复进展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →