小米剧透 MiMo-V3:HySparse2 架构让百万 token 预填充计算量降约 5 倍

量子位 · wechat · 2026-09-24

MiMo-V2.6 刚发布,小米罗福莉就剧透了 MiMo-V3 的核心新架构 HySparse2,针对 Agent 长任务中工具返回内容动辄数万字、预填充成本持续累积的痛点做了三层改造:

效果:80B 总参、每 token 激活约 3B 的 MoE 配置下,100 万 token 上下文处预填充计算量约为 HybridSWA 的 1/5.02,FP8 下 KVCache 从 12.09GB 降至 2.69GB(约 4.5 倍)。256k 上下文的 RULER-v2 拿到 58.45,远超 HySparse 的 32.61 和 HybridSWA 的 35.74;普通知识与代码能力则与对照大致持平。论文评估到 256k,实际延迟与任务表现仍待 MiMo-V3 发布后验证。

所属事件:小米剧透MiMo-V3新架构HySparse2(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →