小米 MiMo-V2.6 公开最大规模 RL 训练:Pro 花费 260 万美元
KyeGomezB · x · 2026-09-22
小米 MiMo 团队发布 MiMo-V2.6 技术报告,公开其迄今最大的 RL 扩展训练,并开源训练动态、RL 环境与框架。
- 成本:Pro 版 260 万美元、Flash 版 90 万美元;约 44% 花在 rollout、41-44% 在训练、14% 在 grading。
- 规模:每个 RL 步使用 1,568 个 prompt × 16 次 rollout,产生约 2.5 万条轨迹、2.7-3.7B token,上下文最长 1M token。
- 新技术:groupwise agentic grading——对比成功轨迹,将奖励导向更短更高质量的解法,而非所有通过测试的答案等价对待;冻结 MoE router 并建立多层防 reward hacking 防线。
- 领域:主要扩展到编程、通用工作流、视觉任务与网络安全。
- 成绩:DeepSWE Pro 从 58.4 提升到 72.6,Flash 从 48.7 提升到 65.7。
「模型」频道最新
- Huihui 社区推出去审查版 Qwen3.6-35B-A3B,附 MLX 部署格式 — evilsocket · 2026-09-22
- Transformers 运行 GGUF 追平 llama.cpp 性能,GGML 内核立功 — LysandreJik · 2026-09-22
- 68 秒会话被收 132 美元:OpenAI Agents API 计费异常实录 — Emotional-Orange- · 2026-09-22
- 用户吐槽 ChatGPT 免费版诱导刷消息:一次会话被要求贴 30-40 条终端输出 — Active-Ad9741 · 2026-09-22
- 开发者痛批 Claude 文风:油腻自夸改不掉,Grok 与 Kimi 更自然 — georgemillo · 2026-09-22
- ChatGPT Pro $200 暂停新用户,开发者转向 DeepSeek/Qwen CLI 方案 — Red-Lifter · 2026-09-22