PrismQuant 用零空间旋转优化 INT4 量化,70B 模型几乎无损
NanyangTechnologicalUniversity · hf · 2026-09-30
PrismQuant 提出量化器感知的旋转框架,将激活主特征空间与非对称分组 INT4 的常量组子空间对齐:激活离群点的缩小不等于低比特量化更好,关键在于与量化器的对齐。作者把旋转设计形式化为 Ky Fan 迹最大化并给出闭式最优解,用紧凑 Householder 变换实现免梯度构建。在 Llama、Qwen、Mistral 上实验(最大 70B dense 与 30B MoE):W4A4KV4 下 Llama-3.2-3B 达到 SOTA;Llama-3.1-70B 困惑度 3.85、平均零样本准确率 72.46%,仅比全精度低 0.22 个百分点。部署层面 Llama-3.1-8B 实现 1.51 倍 prefill 与 1.22 倍 CUDA Graph decode 加速,decode 峰值显存降低 56.34%。代码已开源。
「Infra」频道最新
- 亚洲输美空运货物 8% 是数据中心配件,每天 30 架全货机 — yacineMTB · 2026-09-30
- 2x 4060 8GB 跑 Gemma 26B:mradermacher 量化实现 75 tok/s — Spiritual_Impress_30 · 2026-09-30
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- Altman:OpenAI 自研芯片 2027 上半年上线,押注推理优势 — johncoogan · 2026-09-30
- 网友爆料:DeepSeek 新模型疑为华为昇腾训练 — teortaxesTex · 2026-09-30
- AAOI 美国垂直整合过激:激光器产线良率仍差,烧掉大量资本开支 — jwt0625 · 2026-09-30