SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍

sehoonkim418 · x · 2026-10-08

哥伦比亚大学等机构团队发布 SketchSSM,针对混合注意力模型中线性注意力层的递归状态读取瓶颈提出新方法:保留全状态更新、只近似状态读取。核心思路是利用低秩状态加权查询近似,离线固定基向量,在每次状态更新时读一次全状态预计算输出并压缩为紧凑 sketch,后续解码步只需组合 sketch 向量与查询相关系数即可重构输出,无需再读全状态。

关键结果:

可作为 vLLM 的 drop-in 使用(pip install sketchssm),论文、博客、代码与校准数据均已开源。

所属事件:SketchSSM:只近似读取状态,线性注意力解码提速(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →