SparseDecoding 解码感知剪枝:对齐生成分布,A100 解码提速至 1.48 倍

encodelab · hf · 2026-10-09

现有基于 Hessian 的免训练逐层剪枝方法用自然序列计算校准,而解码时模型输入是自生成 token,分布偏移导致剪枝后性能受损;且多数方法面向 SpMM,对解码主导的 SpMV 支持有限。

SparseDecoding 框架从两方面入手:

在 Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B/32B 上,长文生成基准持续优于标准固定文本校准,A100 上端到端解码加速最高 1.48 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →