混合注意力后缀缓存复用:编辑轮命中率 29.9% 提回 58.1%
RulinShao · x · 2026-10-02
Rulin Shao 公开基于 SGLang 的混合注意力(全注意力与线性注意力交错)Suffix Cache Reuse 实现细节,附录包含:
- 缓存命中拆解:CLM 上下文编辑会显著拉低命中——编辑轮命中率从 73.9% 掉到 29.9%。
- 改进方案:不丢弃未匹配的后缀缓存而是复用,使编辑轮命中率再提升 28.2%;整体 prefix-reuse FLOPs 从 10.98/Q 降至 7.14/Q,且效果持平。
- 观点:CACHE 空间值得继续做花式操作,除 token 空间外缓存空间也可玩;更易读的博客即将发布。
效率指标已把未命中 KV cache 的重预填充成本计入,故「CLM 更便宜」的结论考虑了较低命中率。
「Infra」频道最新
- AMD 高管亲自提 PR:TokenSpeed 支持 Radeon RX 9070 等 RDNA 4 GPU — zhyncs42 · 2026-10-02
- Michael Burry 质疑 GPU 折旧,Nvidia 发图反驳双方隔空交锋 — firstadopter · 2026-10-02
- 数据中心正在变成巨型电池:2030 年直连储能或达 20-25 GW — ingliguori · 2026-10-02
- 分析师参会:HPE 网络业务成 AI 基建战略核心,AI Helios 有新料 — BenBajarin · 2026-10-02
- 美光 Q4 FY26 财报:更大位元基数与 HBM 支撑「景气更持久」论 — BenBajarin · 2026-10-02
- AWS 大改新手上路:免信用卡注册、$200 免费额度加硬性消费上限 — danbri · 2026-10-02