WUSH-KV:数据自适应变换做 2-bit KV cache 量化,集成 SGLang 降 perplexity
ISTA-DASLab · hf · 2026-10-01
- KV cache 的显存与带宽成本随上下文长度和 batch size 增长,限制长上下文推理效率。ISTA-DASLab 提出 WUSH-KV 低比特 KV cache 量化方法。
- 核心是 WUSH 变换:利用矩阵乘两个因子的二阶统计量构造数据感知变换以降低量化误差;用校准数据分别构造 key 与 value 变换,value 变换折叠进模型权重,key 变换在 RoPE 之后应用。
- 对 QuEST INT 量化器,在温和假设下可证明 WUSH 变换近最优;端到端集成进 SGLang(OSCAR 式 percentile-clipped affine 量化),降低逐层重建误差并在所有测试变换中取得最低端到端 perplexity;2-bit 下与或超越 OSCAR 变换。
「Infra」频道最新
- 算账:Meta Muse 免费策略每用户成本高达 51 美元 — bookwormengr · 2026-10-01
- Delip Rao 看训练日志:多数团队没把 GPU 预算用明白 — deliprao · 2026-10-01
- FT:腾讯向 Oracle 租约 10 万颗 AI 芯片 5 年,价值约 70 亿美元 — rohanpaul_ai · 2026-10-01
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01
- Linewise 视频分析 agent 借 Inco 推理实现单 GPU 吞吐提升 31 倍 — songhan_mit · 2026-10-01
- 存储芯片股亚洲隔夜集体上涨,Java 式狂热回来了? — firstadopter · 2026-10-01