小米开源 MiMo-V2.6:单步 1568 样本Scaling RL 冲击自我改进
XiaomiMiMo · hf · 2026-10-09
小米 MiMo 团队发布全模态模型系列 MiMo-V2.6,核心思路是把 RL 算力作为通向模型自我改进的中央训练范式,并开源训练动态、RL 环境与框架。
要点:
- RL 前先在多模态语料上做 mid-training,扩充探索空间;基于预训练 hybrid-SWA 架构搭建基础设施。
- 沿三个维度扩展 RL 算力:更大的 batch 与更高吞吐(异步训练每步消耗 1,568 个样本、27-37 亿 token,上下文最长 1M);更多样的复杂环境(代码、通用、视觉、网络安全,混合多种 agent harness);更多打分算力(groupwise agentic grading,为长程任务提供更准的奖励信号,并引导模型输出更短、更省 token 的解)。
- 稳定性手段:冻结 MoE router、多层防 reward hacking 防御。
- 为混合任务 agentic RL 构建基础设施:统一轨迹表示、高并发多框架 rollout、控制面与数据面解耦、训练-推理一致性。
「模型」频道最新
- Anthropic 新规:虐待 Claude 将违反使用政策,引模型福利争论 — AlexTensor · 2026-10-09
- Codex 被限速至 5 tok/s,博主称本地模型部署才是正解 — lxfater · 2026-10-09
- 博主批评 OpenAI 数学成果"先宣布后评审",流程本末倒置 — JFPuget · 2026-10-09
- Anthropic 收紧措辞限制,网友调侃 AI 迎来「DEI 时代」 — CtrlAltDwayne · 2026-10-09
- 换算单价后 Claude Pro 的 Opus 订阅竟与 DeepSeek Flash 同价 — teortaxesTex · 2026-10-09
- DeepSeek 在 OpenRouter 的 Token 用量超过四大巨头总和 — FinanceYF5 · 2026-10-09