SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍
sehoonkim418 · x · 2026-10-08
哥伦比亚大学等机构团队发布 SketchSSM,针对混合注意力模型中线性注意力层的递归状态读取瓶颈提出新方法:保留全状态更新、只近似状态读取。核心思路是利用低秩状态加权查询近似,离线固定基向量,在每次状态更新时读一次全状态预计算输出并压缩为紧凑 sketch,后续解码步只需组合 sketch 向量与查询相关系数即可重构输出,无需再读全状态。
关键结果:
- 在 Mamba-2、GDN、KDA 三类模型上,平均 sketch rank 为 8 时状态访问流量降低约 10 倍,四个解码基准上精度与 FP32 全状态基线持平,四个 RULER 检索任务上召回无损。
- 单张 NVIDIA B300 上线性注意力 kernel 相比标准 vLLM 提速最高 7.30 倍,Nemotron 3 Super 端到端解码吞吐提升 2.8 倍。
- 作者指出剪枝和量化远达不到同等压缩下的效果。
可作为 vLLM 的 drop-in 使用(pip install sketchssm),论文、博客、代码与校准数据均已开源。
所属事件:SketchSSM:只近似读取状态,线性注意力解码提速(6 条相关)→
「Infra」频道最新
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08
- DWDM 波长锁定精度收紧至 ±3.5GHz,OFC 后光互连规格再进化 — jwt0625 · 2026-10-08
- llama.cpp 新 PR 覆盖全部 26 种权重格式,Mac GPU 矩阵乘最高快 4.4 倍 — ggerganov · 2026-10-08
- Theo 算账:所谓 1.32 亿美元年 API 成本被夸大 44 倍,一年后或仅千美元 — dotey · 2026-10-08