线性注意力解码占 75% 延迟,SketchSSM 提速 2.8 倍

sehoonkim418 · x · 2026-10-08

作者指出混合 LLM 中线性注意力的瓶颈:每步解码都要从 GPU 内存读取完整循环状态,大 batch 下线性注意力可占解码延迟的 75%。此前的 ReplaySSM 通过缓冲更新、按窗口批量写状态,把写开销摊薄,但读取仍在,线性注意力仍占约 53% 延迟。为此提出 SketchSSM:写完整状态、读紧凑 sketch(概要),在不累积误差的前提下将状态空间与线性注意力模型的解码提速至 2.8 倍。

所属事件:SketchSSM 发布:近似读状态,线性注意力解码提速 2.8 倍(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →