vLLM 引入 HiSparse 混合稀疏注意力,长上下文并发翻两番

vLLM 团队(RedHat AI、Prime Intellect 等社区共建)宣布与 HiSparse 团队合作推进稀疏注意力落地。Hybrid HiSparse 基于 Sparse MLA,只关注 top-K token 以降低内存带宽压力,且在 KV cache 溢出 GPU 时仍可继续解码。实测显示在 8×H200 上支持 1M 上下文时,并发从 5 提升到 25,翻了两番。

2026-09-09 ~ 2026-09-09 · 2 条相关