混合注意力后缀缓存复用:编辑轮命中率 29.9% 提回 58.1%

RulinShao · x · 2026-10-02

Rulin Shao 公开基于 SGLang 的混合注意力(全注意力与线性注意力交错)Suffix Cache Reuse 实现细节,附录包含:

效率指标已把未命中 KV cache 的重预填充成本计入,故「CLM 更便宜」的结论考虑了较低命中率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →