小米披露MiMo-V3架构HySparse2:KV Cache占用降至约1/4.5
智东西 · wechat · 2026-09-24
小米 MiMo 负责人罗福莉发文提前披露 MiMo-V3 的核心架构组件 HySparse2,技术论文同步公布,距 MiMo-V2.6 发布仅过去两天。
HySparse2 针对多轮 Agent 推理的三大痛点:长输入 Prefill 计算量大、KV Cache 占用高、长上下文检索难。核心是两级 KV 共享(KV Bridging + KV Reuse),让 Prefill 只需跑完前半部分模型即可退出——49 层模型部署时 Prefill 节点只需前 25 层,权重接近减半;同时把 Block 级稀疏选择改为 Token 级,可跨上下文精准选取相关 Token。
在 100 万 Token 上下文下,相比 MiMo-V2.6 的 HybridSWA,HySparse2 的 Prefill 计算量降至约 1/5,KV Cache 占用降至约 1/4.5(2.69GB 对 12.09GB);经后训练后 RULER-v2 得分比 HybridSWA 高 18.65 个百分点,AgentPPL 和 LongPPL 均更低。通用能力与基线大致相当,属效率与能力的架构取舍。
所属事件:小米披露MiMo-V3架构HySparse2,KV缓存缩至约1/4.5(4 条相关)→
「Infra」频道最新
- 模型"被削弱"另有解释?Epoch AI 指异构硬件致输出质量不一 — zacharynado · 2026-09-24
- 曝 Modal 与 Baseten 正洽谈融资,助企业运行 AI 负载 — dinabass · 2026-09-24
- 哥伦比亚大学 CUbiC 论文探讨边缘到云 AI 基础设施与 CPO 路线 — jwt0625 · 2026-09-24
- 混元研究:调学习率扩大 batch size,PPO 训练吞吐提升至 2.29 倍 — TencentHunyuan · 2026-09-24
- Alchemy 为状态存储加 Cloudflare Access 保护,支持 CI 服务令牌 — samgoodwin89 · 2026-09-24
- 一条 prompt 让 agent 自己核算账单:价格涨还是用量涨? — gethackteam · 2026-09-24