小米剧透 MiMo-V3:HySparse2 架构让百万 token 预填充计算量降约 5 倍
量子位 · wechat · 2026-09-24
MiMo-V2.6 刚发布,小米罗福莉就剧透了 MiMo-V3 的核心新架构 HySparse2,针对 Agent 长任务中工具返回内容动辄数万字、预填充成本持续累积的痛点做了三层改造:
- 预填充提前退出:模型拆为前段 self-decoder 与后段 cross-decoder,前半段用全注意力+滑动窗口,后半段用全注意力+稀疏注意力,中间以 KV Bridging 只连接全注意力层。新材料只需走完前段预填充即可停止;配合预填充/生成分离部署,49 层模型中预填充节点只需放前 25 层,内存接近减半。
- token 级稀疏选择:把上一代按 64-token 块选择改为按单个 token 挑选(选 1024 个全局 token+强制保留最近 128 个),消融实验中 RULER-v2 提升 6.57、双线索 MRCR-v2 提升 8.14 个百分点。
- 两级 KV 共享:稀疏层复用全注意力层的 KVCache 与 token 选择结果,去掉独立滑动窗口分支。
效果:80B 总参、每 token 激活约 3B 的 MoE 配置下,100 万 token 上下文处预填充计算量约为 HybridSWA 的 1/5.02,FP8 下 KVCache 从 12.09GB 降至 2.69GB(约 4.5 倍)。256k 上下文的 RULER-v2 拿到 58.45,远超 HySparse 的 32.61 和 HybridSWA 的 35.74;普通知识与代码能力则与对照大致持平。论文评估到 256k,实际延迟与任务表现仍待 MiMo-V3 发布后验证。
所属事件:小米剧透MiMo-V3新架构HySparse2(5 条相关)→
「模型」频道最新
- 用户实测:Opus 5.5 音频感知极强,会用频谱图处理声音 — repligate · 2026-09-24
- GPT-6 Astra 实机通关《求生之路2》:75 秒首轮 Dead Center — imjustnewatai · 2026-09-24
- 同一提示词 GPT-3.5 全说漏,GPT-4 却 30/30 返回空响应 — rayanpal_ · 2026-09-24
- Box 实测 Opus 5.5:token 省 63%,速度提升 30% 且更便宜 — bcherny · 2026-09-24
- Claude Opus 5.5 Max 登顶 Code Arena,领先 GPT-6 Astra 26 分 — airesearch12 · 2026-09-24
- Pokee 36B 智能体模型跑通骁龙 X2 Elite:32GB 内存全本地 — Kyrannio · 2026-09-24