微软OasisKV:预测性稀疏预取,推理吞吐提升1.69倍
microsoft · hf · 2026-08-11
微软提出 OasisKV,一种面向 LLM 推理的内存中心系统设计。它利用解码时注意力稀疏性,仅将最相关 token 的 KV 条目保留在 HBM 中,并通过投机解码的 lookahead tokens 预测未来重要 token,从高容量内存层预取。基于 vLLM 实现,在 2048 token KV 预算下精度损失仅 0.7 点;推理工作负载吞吐提升 1.69 倍(精度损失 0.1 点),多 GPU 长上下文场景最高 2.1 倍;在 prefill-decode 分离下,吞吐约 2 倍,KV 占用减少 6.5-9.7 倍。
「Infra」频道最新
- 实测 Muse Glimmer 30B 扩展至 1M 上下文:检索全通过 — StartupTim · 2026-08-11
- vLLM 上 Muse Glimmer 投机解码需 6 个补丁,速度从 25 提升至 57 tok/s — j4ys0nj · 2026-08-11
- 摩根大通看好HBM:预计FY27合约价涨幅超50% — zephyr_z9 · 2026-08-11
- 4卡 DGX Spark 实测:GLM-5.2 推理飙至 44.6 tok/s — EAccelerate_42 · 2026-08-11
- 英伟达 AI 硬件基材路线图:从玻璃到石英的跨越 — zephyr_z9 · 2026-08-11
- 摆脱云依赖:个人本地大小模型协同智能体构想 — gnukeith · 2026-08-11