港城大与腾讯提出Sherry:3:4稀疏把三值权重打成1.25bit

Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification

Hong Huang, Decheng Wu, Qiangqiang Hu, Guanghua Yu, Jinhai Yang, Jianchen Zhu, Xue Liu, Dapeng Wu

cs.LG, cs.AI

2026-01-12

Sherry强制每四个三值权重里恰好三个非零,打成5bit得到1.25bit。LLaMA-3.2-1B五任务平均0.519,与1.67bit的Tequila持平;消费级i7上0.7B跑到148.27 tok/s,比2bit更快更小。

这篇在解决什么

三值量化把权重限制在{-1,0,+1},乘法换成查表加加法,端侧很香。真要打包进CPU,就卡在两种笨办法之间:每个权重垫成2bit,密度跟INT2没差;或者3个权重塞进5bit(约1.67bit),3路分组对不上SIMD的2的幂通道,往往更慢。理论下限约1.58bit,落地要么浪费位,要么浪费吞吐。

Sherry的切口是把三值里本来就有的0,变成有规律的0。

方法

约束很死:每连续4个权重恰好3个非零(±1),1个为0。4选3再乘8种符号,刚好32种,塞进5bit,平均1.25bit。块长4对得上SIMD;稀疏率25%,论文引用前人结论,三值稀疏超过50%会崩;5bit索引拆成1个符号位加4个查找位,能塞进AVX2 vpshufb的16字节表。量化用贪心Sparse-AbsMean:块内绝对值最小的置零,其余取符号,通道缩放是非零绝对值的均值。

硬剪3:4会把权重推向两极,梯度有效秩掉到跟二值差不多(文中ER<750,矩阵维4096),论文叫weight trapping。Arenas在训练时给线性层加一条退火的全精度残差:Y=XTα+λt XW,λt按余弦衰减到0。残差把潜在权重大小重新接到损失上,梯度不再被均匀的±1/0图案抹平。推理时残差消失,没有额外开销。QAT用10B token的UltraFineWeb,组大小默认128,底座是LLaMA-3.2的1B和3B。

推理接BitNet.cpp那套LUT:离线把4元组打成index+sign,在线用激活建局部表,查完累加再乘通道scale。

结果

LLaMA-3.2-1B五任务平均,Sherry 0.519,Tequila(1.67bit)也是0.519,BF16是0.558。ARC-c上Sherry 0.309对Tequila 0.305,跟BF16的0.313只差0.004。3B上Sherry 0.567,Tequila 0.576,Spectra(3.9B,1.67bit)0.567。相对BitNet 1.3B的0.483,1.25bit平均高出约3.6分,位宽少约四分之一。

模型位宽五任务平均对照
Sherry 1B1.250.519Tequila 0.519 / BF16 0.558
Sherry 3B1.250.567Tequila 0.576 / BF16 0.636
0.7B CPU1.25148.27 tok/s, 205.5MBTL2 116.83 / 233.4MB
3B CPU1.2545.55 tok/s, 712.4MBTL2 38.80 / 846.0MB

粒度上per-tensor 0.502、per-channel 0.513、per-group-128 0.519,Arenas撑住了粗粒度。消融里Arenas对1bit、1.25bit、1.67bit都有提升;退火用线性、指数、余弦都行,加warmup更好。摘要写「零精度损失、省25% bit、快10%」,1B平均分确实追平Tequila;3B平均略低0.009。速度上3B相对1.67bit快约18%,相对2bit约9%,「10%」是比较含糊的口径。体积相对1.67bit,3B从846MB到712MB,约16%。

为什么重要

三值社区一直在1.58/1.67和2bit之间晃。Sherry证明可以用结构化稀疏换硬件友好的1.25bit,精度不必掉出Tequila那一档。端侧CPU、查表引擎、1到3B模型,这是它的甜区。Arenas作为训练期旁路,思路能挪到别的硬约束量化上,推理零成本。

不要指望这篇直接给你70B服务端方案,也别把它当激活量化。

局限与存疑

作者自己写了四条:只测到3B;没碰NVIDIA Sparse Tensor Core;只量化权重,激活和KV仍是BF16;Arenas加训练算力。还可以再泼一点冷水。评测只有PIQA、ARC、HellaSwag、WinoGrande,没有MMLU、GSM8K、长上下文。QAT基线复现用了同一10B token,但BitNet、Spectra报的是原论文数字,数据配方并不齐。摘要的「零损失」只对1B对Tequila成立,3B已经让出平均分。代码挂在AngelSlim仓库,独立复现成本仍是32卡QAT。

术语

原文与代码

社区讨论

相关论文

全部论文解读