SketchSSM 补充数据:rank 8 下状态流量降 11 倍且精度近无损
sehoonkim418 · x · 2026-10-08
SketchSSM 作者补充关键数据:在平均 sketch rank 为 8 的设置下,该方法将线性注意力的状态访问流量降低 11 倍,并在多个推理与检索基准上保持近无损精度,覆盖 Mamba-2、Gated DeltaNet 和 KDA 架构。
作者强调,同等压缩水平下,剪枝和量化早在此之前就已失效,凸显该方法在状态压缩上的独特优势。解码 kernel 最高提速 7.3 倍、Nemotron 3 Super 端到端吞吐提升 2.8 倍,可作为 vLLM 插件直接安装使用。
所属事件:SketchSSM:只近似读取状态,线性注意力解码提速(6 条相关)→
「Infra」频道最新
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08
- DWDM 波长锁定精度收紧至 ±3.5GHz,OFC 后光互连规格再进化 — jwt0625 · 2026-10-08
- llama.cpp 新 PR 覆盖全部 26 种权重格式,Mac GPU 矩阵乘最高快 4.4 倍 — ggerganov · 2026-10-08
- Theo 算账:所谓 1.32 亿美元年 API 成本被夸大 44 倍,一年后或仅千美元 — dotey · 2026-10-08