小米披露MiMo-V3架构HySparse2:KV Cache占用降至约1/4.5

智东西 · wechat · 2026-09-24

小米 MiMo 负责人罗福莉发文提前披露 MiMo-V3 的核心架构组件 HySparse2,技术论文同步公布,距 MiMo-V2.6 发布仅过去两天。

HySparse2 针对多轮 Agent 推理的三大痛点:长输入 Prefill 计算量大、KV Cache 占用高、长上下文检索难。核心是两级 KV 共享(KV Bridging + KV Reuse),让 Prefill 只需跑完前半部分模型即可退出——49 层模型部署时 Prefill 节点只需前 25 层,权重接近减半;同时把 Block 级稀疏选择改为 Token 级,可跨上下文精准选取相关 Token。

在 100 万 Token 上下文下,相比 MiMo-V2.6 的 HybridSWA,HySparse2 的 Prefill 计算量降至约 1/5,KV Cache 占用降至约 1/4.5(2.69GB 对 12.09GB);经后训练后 RULER-v2 得分比 HybridSWA 高 18.65 个百分点,AgentPPL 和 LongPPL 均更低。通用能力与基线大致相当,属效率与能力的架构取舍。

所属事件:小米披露MiMo-V3架构HySparse2,KV缓存缩至约1/4.5(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →