ARCHead:大模型输出头量化新方法,存储大幅降低且几乎无损
Şuayp Talha Kocabay · hf · 2026-08-06
权重量化虽能显著减少 Transformer 模块的存储,但大模型的输出头通常仍需保留高精度格式。直接量化会严重扰乱词表的 logit 分布。
为此,研究者提出 ARCHead,一种结合了量化低秩核心、分组 INT4 残差和基于激活指标低秩校正的压缩器。该方法完全摒弃了密集的 BF16 输出头,将其持久化存储减少了 3.7-3.9 倍。
在 Qwen3-8B-Base 模型上的实验表明,ARCHead 仅使用 25.6% 的 BF16 输出头存储,便达到了 1.007 的相对困惑度,远优于同等存储空间下的朴素 INT4 量化(1.14-1.16)。该方法可与 AWQ 等模块量化器完美互补。
「Infra」频道最新
- 单台 Spark 硬件跑 DeepSeek V4,本地推理速度达 95 tok/s — Rasmic · 2026-08-06
- 本地部署进阶:一台机器混用N卡和A卡跑不同大模型 — Curious-Pen5547 · 2026-08-06
- Luminal 编译器探索极速 Megakernels,突破带宽与算力极限 — AccBalanced · 2026-08-06
- Mac 本地大模型选型指南:16G 内存也能跑 27B 模型 — JosephJacks_ · 2026-08-06
- 不到10GB显存跑276B大模型!Mference实测近3 tok/s — Blahblahblakha · 2026-08-06
- RTX 3090 实测:INT8 量化让 MiniMax 视频生成提速翻倍 — Nevaditew · 2026-08-06