微软OasisKV:预测性稀疏预取,推理吞吐提升1.69倍

microsoft · hf · 2026-08-11

微软提出 OasisKV,一种面向 LLM 推理的内存中心系统设计。它利用解码时注意力稀疏性,仅将最相关 token 的 KV 条目保留在 HBM 中,并通过投机解码的 lookahead tokens 预测未来重要 token,从高容量内存层预取。基于 vLLM 实现,在 2048 token KV 预算下精度损失仅 0.7 点;推理工作负载吞吐提升 1.69 倍(精度损失 0.1 点),多 GPU 长上下文场景最高 2.1 倍;在 prefill-decode 分离下,吞吐约 2 倍,KV 占用减少 6.5-9.7 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →