小米 MiMo-V2.6 单步 RL 处理 27-37 亿 token,剑指模型自我提升
Dr_Singularity · x · 2026-09-23
- 小米 MiMo-V2.6 是其迄今最大规模的强化学习扩展尝试,覆盖编程、通用推理、视觉、自动化与网络安全。
- 每步 RL 训练处理约 1568 个样本、27-37 亿 token,上下文长度达 100 万 token。
- 不依赖单一 benchmark,而是用多复杂环境与更强的 agentic grader 提升长程推理,并推动模型给出更高效解法。
- 训练全程多个 benchmark 成绩持续上升,说明更大规模 RL 仍有很大提升空间;小米明确将其定位为朝模型自我提升方向扩展。
所属事件:小米 MiMo-V2.6 大规模强化学习,单步处理数十亿 token(2 条相关)→
「模型」频道最新
- GPT-6 Astra 登顶 ZeroBench:三项指标全面超越人类基线 — Waiting4AniHaremFDVR · 2026-09-23
- 用户吐槽:Opus 5.5 一聊到他的文章就触发安全监控 — scaling01 · 2026-09-23
- 用户惊呼 Opus 5.5 太强:好到不真实,等官方削弱? — iamsahaj_xyz · 2026-09-23
- 用户实测:Claude 输出更可读,考虑重回主力模型 — xeophon · 2026-09-23
- 网友晒 Claude Opus 5.5 独立完成代码审查,「抢了 Theo 的活」 — 0xkarasy · 2026-09-23
- GPT-6 Luna 多项基准不敌上代 5.6?综合打平但价格大降 — DataLearnerAI · 2026-09-23