小米 MiMo-V2.6 直播 RL 训练:每步 20 亿 token,斯坦福 Marin 同步直播预训练
stanfordnlp · x · 2026-09-20
Stanford NLP 账号转发推荐了两个当前最值得关注的公开模型训练实验:
- MiMo-V2.6 的 RL 训练直播:团队沉寂数月专注研究「RL 能扩展到多远」,三个规模化维度:
- 算力:每步约 20 亿 token,1568 个提示 × 16 个 rollout,全异步
- 环境与 harness:多任务 agentic RL,单次运行混合多个 harness
- 评分器算力:agentic 组内 credit assignment,结合测试用例与 rubric 奖励
- 细节将在未来几周逐步开源,训练过程可实时围观
- 斯坦福 Marin 的实时预训练:Percy Liang 与 OpenAthena 团队主导,同样全程公开,读者可以像团队成员一样跟进
两条直播让外人第一次能像内部成员一样「追更」大模型训练全程。
「模型」频道最新
- Laya 开源:322M 参数单次前向做决策,33ms 出结构化结果 — Saboo_Shubham_ · 2026-09-20
- Laya:单次前向 33ms 出结构化决策的 100% 开源模型 — Saboo_Shubham_ · 2026-09-20
- 决策模型 Jev 免费上线 Venice API:只回类型化答案不写散文 — 0xAllen_ · 2026-09-20
- 博主晒编码模型+工具栈:Kimi K3 最佳开源,Claude Code 翻倍烧钱 — Yuchenj_UW · 2026-09-20
- 评测者称纯代码启发式策略可在 Craftax 上胜过大模型 — JoshPurtell · 2026-09-20
- OpenAI Codex 全员重置已生效,官方预告周二有大发布 — kimmonismus · 2026-09-20