MiMo V2.6 发布,团队拟开源 7000 个 RL 训练环境
teortaxesTex · x · 2026-09-22
MiMo V2.6 正式上线。配套技术论文被评价为非常值得一读,团队还计划开源约 7000 个 RL 训练环境,对强化学习研究者是重要资源。
「模型」频道最新
- 曝 OpenAI 训练 24 天的新模型已解决百余个数学开放难题 — IgorCarron · 2026-09-22
- Paradigm 发布 Limite 1B,专攻高频数学推理的 1B 小模型 — tensorqt · 2026-09-22
- 推主推测 Grok Pro 线为 Flash 线延伸,mxfp4 QAT 服务 RL rollout — stochasticchasm · 2026-09-22
- 从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT — stochasticchasm · 2026-09-22
- 扩散 LM 快 5-10 倍却没火,Jev 赶上 agent 变强但慢的时机 — eliza_luth · 2026-09-22
- GPT-6 调推理强度不再失效提示缓存,Codex 支持中途自适应推理 — daniel_mac8 · 2026-09-22