ARCHead:大模型输出头量化新方法,存储大幅降低且几乎无损

Şuayp Talha Kocabay · hf · 2026-08-06

权重量化虽能显著减少 Transformer 模块的存储,但大模型的输出头通常仍需保留高精度格式。直接量化会严重扰乱词表的 logit 分布。

为此,研究者提出 ARCHead,一种结合了量化低秩核心、分组 INT4 残差和基于激活指标低秩校正的压缩器。该方法完全摒弃了密集的 BF16 输出头,将其持久化存储减少了 3.7-3.9 倍。

在 Qwen3-8B-Base 模型上的实验表明,ARCHead 仅使用 25.6% 的 BF16 输出头存储,便达到了 1.007 的相对困惑度,远优于同等存储空间下的朴素 INT4 量化(1.14-1.16)。该方法可与 AWQ 等模块量化器完美互补。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →