小米MiMo长文本推理优化实践
burny_tech · x · 2026-07-19
探讨了混合滑动窗口注意力机制如何在生产环境中大幅降低长上下文推理的成本,并以小米 MiMo-V2.5 模型为例展示了具体工程实现。
核心优化在于重构 KV Cache 系统,使 SWA 仅保留近期窗口而非全部上下文,同时安全地跨请求复用前缀。结合更好的缓存路由、分布式缓存和多模态预处理,最终实现了:
- 93%+ 的 KV 缓存命中率
- 预填充速度提升约 40%
- 解码 KV 容量扩大约 5 倍
- 编码器吞吐量翻倍(2x)
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11