SketchSSM 借低秩查询压缩将 Mamba 类模型状态流量降 11 倍
sehoonkim418 · x · 2026-10-08
- 核心结果:在平均 sketch rank 为 8 时,SketchSSM 能将 SSM 的状态读取流量降低 11 倍,同时在多个推理与记忆类 benchmark 上保持近乎无损的准确率。作者称剪枝和量化在远未达到这个程度时就已失效。
- 适用范围:方法在 Mamba-2、Gated DeltaNet 和 KDA 多种架构上均有效。
- 原理:在同一窗口内状态不变、只有 query 变化,因此可将 query 压缩到一个小型低秩基上,只需为该基计算一次状态输出;每个 query 都是基的线性组合,其输出也等于存储输出的同组合,无需读取完整状态。
所属事件:SketchSSM 发布:近似读状态,线性注意力解码提速 2.8 倍(8 条相关)→
「Infra」频道最新
- 拆解 Chrome DecisionModel API:完整提示词与引擎实测 — dejanseo · 2026-10-08
- 中国电力过剩催生数据中心,浸没冷却技术源自矿机 — teortaxesTex · 2026-10-08
- omarchy-cluster 把 753B 参数 GLM-5.3 拆进四台旧 Mac 跑全量模型 — natesiggard · 2026-10-08
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08