线性注意力解码占 75% 延迟,SketchSSM 提速 2.8 倍
sehoonkim418 · x · 2026-10-08
作者指出混合 LLM 中线性注意力的瓶颈:每步解码都要从 GPU 内存读取完整循环状态,大 batch 下线性注意力可占解码延迟的 75%。此前的 ReplaySSM 通过缓冲更新、按窗口批量写状态,把写开销摊薄,但读取仍在,线性注意力仍占约 53% 延迟。为此提出 SketchSSM:写完整状态、读紧凑 sketch(概要),在不累积误差的前提下将状态空间与线性注意力模型的解码提速至 2.8 倍。
所属事件:SketchSSM 发布:近似读状态,线性注意力解码提速 2.8 倍(8 条相关)→
「Infra」频道最新
- 拆解 Chrome DecisionModel API:完整提示词与引擎实测 — dejanseo · 2026-10-08
- 中国电力过剩催生数据中心,浸没冷却技术源自矿机 — teortaxesTex · 2026-10-08
- omarchy-cluster 把 753B 参数 GLM-5.3 拆进四台旧 Mac 跑全量模型 — natesiggard · 2026-10-08
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08