SparseDecoding 解码感知剪枝:对齐生成分布,A100 解码提速至 1.48 倍
encodelab · hf · 2026-10-09
现有基于 Hessian 的免训练逐层剪枝方法用自然序列计算校准,而解码时模型输入是自生成 token,分布偏移导致剪枝后性能受损;且多数方法面向 SpMM,对解码主导的 SpMV 支持有限。
SparseDecoding 框架从两方面入手:
- 算法侧:从稠密模型自回归生成(排除 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标对齐解码激活分布
- 系统侧:开发基于 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵-向量内核
在 Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B/32B 上,长文生成基准持续优于标准固定文本校准,A100 上端到端解码加速最高 1.48 倍。
「Infra」频道最新
- OpenAI 收入口径引抛售:SOX 跌 3.4%,TSMC 9 月营收却逆势涨 55% — tengyanAI · 2026-10-09
- 40G 显存训练 Qwen3.8-Flash-Next:LoRA over GGUF 无需 CPU offload — woct0rdho · 2026-10-09
- Nunchux 推理引擎入驻 AMD AI 推理生态,优化 Instinct GPU 多模态推理 — junyanz89 · 2026-10-09
- tinygrad 用 4 台自研 tinybox 承载 GitHub Actions CI — AIFlow_ML · 2026-10-09
- OpenAI 万级并发 Agent 耗 1300 亿 token,slime v0.4.0 应对 RL 扩展 — teortaxesTex · 2026-10-09
- TokenRouter 实现 token 级 LLM 路由服务,解码吞吐提升最高 64 倍 — nics-efc · 2026-10-09