SketchSSM 补充数据:rank 8 下状态流量降 11 倍且精度近无损

sehoonkim418 · x · 2026-10-08

SketchSSM 作者补充关键数据:在平均 sketch rank 为 8 的设置下,该方法将线性注意力的状态访问流量降低 11 倍,并在多个推理与检索基准上保持近无损精度,覆盖 Mamba-2、Gated DeltaNet 和 KDA 架构。

作者强调,同等压缩水平下,剪枝和量化早在此之前就已失效,凸显该方法在状态压缩上的独特优势。解码 kernel 最高提速 7.3 倍、Nemotron 3 Super 端到端吞吐提升 2.8 倍,可作为 vLLM 插件直接安装使用。

所属事件:SketchSSM:只近似读取状态,线性注意力解码提速(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →