SketchSSM 发布:近似读状态,线性注意力解码提速 2.8 倍

哥伦比亚大学等机构团队发布 SketchSSM,解决混合架构 LLM 中线性注意力解码的显存读取瓶颈:在平均 sketch rank 为 8 的设置下将状态访问流量降低 11 倍,解码提速 2.8 倍(另有数据称最高 7.3 倍),且在多个推理与记忆类基准上精度近无损,覆盖 Mamba-2、Gated DeltaNet 等模型。由于读状态是大 batch 解码的主要开销,该方法对长推理和高并发服务有直接实用价值。

已确认

为什么重要

2026-10-08 ~ 2026-10-08 · 8 条相关

一手来源