SketchSSM 发布:近似读状态,线性注意力解码提速 2.8 倍
哥伦比亚大学等机构团队发布 SketchSSM,解决混合架构 LLM 中线性注意力解码的显存读取瓶颈:在平均 sketch rank 为 8 的设置下将状态访问流量降低 11 倍,解码提速 2.8 倍(另有数据称最高 7.3 倍),且在多个推理与记忆类基准上精度近无损,覆盖 Mamba-2、Gated DeltaNet 等模型。由于读状态是大 batch 解码的主要开销,该方法对长推理和高并发服务有直接实用价值。
已确认
- 背景:混合 LLM 中线性注意力每步解码需从 GPU 显存读取完整循环状态,大 batch 下可占解码延迟高达 75%;此前的 ReplaySSM 通过缓冲更新、按多步窗口只写一次状态缓解了写开销,但读取仍存,线性注意力仍占约 53% 的延迟。
- 核心思路:保持全量状态更新,只近似状态读取。利用低秩状态加权查询近似,离线固定基向量,每次状态更新时读一次全状态预计算输出。
- 机制细节(作者解释):窗口内状态不变、只有 query 变化,因此把 query 压缩到小的低秩基上,每窗口只需为该基计算一次状态输出;后续 query 是基的组合,其输出即存储输出的同组合,窗口内无需读取完整状态。
- 误差控制:每窗口一次性更新完整状态并在同一 kernel 内刷新紧凑 sketch,窗口内每步只读 sketch,压缩误差从不写回状态。作者对比指出,剪枝/量化直接压缩状态会让误差逐步累积,长推理任务即使 2–4 倍流量降低也明显掉准。
- 结果:rank 8 下状态读取流量降低 11 倍,多个推理与检索基准精度近无损;解码加速 2.8 倍,论文亦报告最高 7.3 倍提速。
为什么重要
- 线性注意力读取瓶颈是大 batch 服务场景的主要延迟来源,SketchSSM 提供了不牺牲状态精确性、误差不累积的加速路径,对 Mamba 类与混合注意力模型的长推理部署具有直接意义。
2026-10-08 ~ 2026-10-08 · 8 条相关
一手来源
- SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍 — sehoonkim418 ·
- SketchSSM 补充数据:rank 8 下状态流量降 11 倍且精度近无损 — sehoonkim418 ·
- SketchSSM 发布:写全状态、读 sketch,解码加速 2.8 倍 — sehoonkim418 ·
- 【源头】SketchSSM 发布:写全状态、读 sketch,解码加速 2.8 倍 — sehoonkim418 · 2026-10-08
- 线性注意力解码占 75% 延迟,SketchSSM 提速 2.8 倍 — sehoonkim418 · 2026-10-08
- 线性注意力占大 batch 解码延迟 75%,读状态成瓶颈 — sehoonkim418 · 2026-10-08
- SketchSSM 思路:只近似读状态,压缩误差不写入状态 — sehoonkim418 · 2026-10-08
- SketchSSM 解读:低秩基近似读状态,窗口内免全量读 — sehoonkim418 · 2026-10-08
- SketchSSM 借低秩查询压缩将 Mamba 类模型状态流量降 11 倍 — sehoonkim418 · 2026-10-08
- 【源头】SketchSSM 补充数据:rank 8 下状态流量降 11 倍且精度近无损 — sehoonkim418 · 2026-10-08
- 【源头】SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍 — sehoonkim418 · 2026-10-08