Xiaomi MiMo-V2.6 details its largest RL scaling run: $2.6M, 1M-token contexts
KyeGomezB · x · 2026-09-22
Xiaomi's MiMo team released a technical report on MiMo-V2.6, its largest RL scaling run to date, with open-sourced training dynamics, RL environments and framework.
- Cost: $2.6M for Pro, $0.9M for Flash; 44% spent on rollouts, 41-44% on training, 14% on grading.
- Scale: each RL step consumes 1,568 prompts × 16 rollouts, producing 25K trajectories and 2.7-3.7B tokens at contexts up to 1M tokens.
- Techniques: groupwise agentic grading — comparing successful trajectories and shifting reward toward shorter, higher-quality solutions; frozen MoE router plus multi-layer defenses against reward hacking.
- Domains: coding, general workflows, visual tasks, cybersecurity.
- Results: DeepSWE improved from 58.4 → 72.6 (Pro) and 48.7 → 65.7 (Flash).
More from Models
- OpenRouter silently ignores effort params — benchmark via native API endpoints, not assumptions — PawelHuryn · 2026-09-22
- Abliterated Qwen3.6-35B-A3B released in MLX format for local Mac inference — evilsocket · 2026-09-22
- Probes confirm Xiaomi's MiMo-V2.6-Pro reasoning effort dial does nothing on OpenRouter — PawelHuryn · 2026-09-22
- Transformers Now Runs GGUF at llama.cpp Speed via GGML Kernels — LysandreJik · 2026-09-22
- 68-Second OpenAI Agents API Session Racked Up $132 in 'Container Usage' — 366 Hours of Billed Time With No Trace — Emotional-Orange- · 2026-09-22
- ChatGPT Free Tier Asked a Coder to Paste Terminal Output 30-40 Times Before Burning Their Message Limit — Active-Ad9741 · 2026-09-22