混元1.8B压到2bit后平均只掉4分,端侧TTFT最高快8倍

AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression

Rui Cen, QiangQiang Hu, Hong Huang, Hong Liu, Song Liu, Xin Luo, Lin Niu, Yifan Tan, Decheng Wu, Linchuan Xie, Rubing Yang, Guanghua Yu, Jianchen Zhu

Hunyuan AI Infra Team

cs.LG, cs.AI

2026-02-07

混元把量化、投机解码、稀疏注意力和多模态剪枝收进开源套件AngelSlim。HY-1.8B-2Bit八项平均63.18,距FP16差3.97分、距INT4只差0.13;Eagle3让Qwen3吞吐大约1.7到1.9倍。

这篇在解决什么

量化、投机解码、稀疏注意力、token剪枝各自都有论文,落到同一套服务上却经常互相踩脚:PTQ的scale和草稿模型对不齐,稀疏核绑死在某个结构上,多模态剪枝还要改Transformer内核。混元把这些收进AngelSlim,目标很具体,从压缩算法走到vLLM/SGLang,中间少接几根线。

它针对的是推理墙:参数太大、上下文太长、视觉和音频token太多,普通GPU和手机芯片都吃力。

方法

工具箱按四条线铺。

量化这条最重。2bit走量化感知训练,权重映射成对称四点{-1.5,-0.5,0.5,1.5}(SEQ),从指令微调权重初始化,用大约89B token的高密度数据做恢复,不从预训练权重重训。三值量化两条:Tequila把死区里的权重临时当bias,训完再融回静态参数;Sherry强制每4个权重恰好3个非零,4个数打进5bit,得到1.25bit且对齐SIMD。PTQ覆盖FP8/INT8/INT4,含AWQ、GPTQ,以及给尖峰分布准备的LeptoQuant:搜索隔离outlier的scale,把主体挤回FP8-E4M3更密的区间。大模型校准还能把中间层卸到CPU,DeepSeek-R1可以单卡做完。

投机解码按Eagle3训草稿模型,目标不是草稿自己写得好,是贴着目标模型的分布。框架抽出hidden state、统一文本/视觉/语音预处理,训完直接挂vLLM和SGLang。

长上下文prefill给了一套免训练稀疏注意力:静态A-shape、Tri-shape、Dilated,动态接MInference、XAttention、FlexPrefill,以及自家Stem。Stem给靠前的token更高保留预算,并用Value向量幅度修正注意力分数,避免分数高、贡献低的token占坑。

多模态剪枝把策略收成返回布尔mask的函数。视觉侧IDPruner用MMR在重要性和多样性之间迭代挑token,不依赖整网attention map;音频侧Samp先按相似度合并相邻段,再按注意力加权做多样性剪枝,模块放在LLM前面,避开FlashAttention拿不到内部分数的问题。

结果

HY-1.8B-2Bit对指令版1.8B做2bit QAT,八项平均63.18。FP16是67.15,差3.97分;INT4 GPTQ是63.31,只差0.13。同等体积的稠密HY-0.5B只有45.28。Apple M4上,256到1024 token输入相对BF16,首token延迟大约快3到8倍;联发科天玑9500上相对4bit,prefill约2倍、生成约1.5倍。

Sherry在LLaMA-3.2-1B上五任务平均0.519,与1.67bit的Tequila持平,位宽少25%。Intel i7-14700HX上,0.7B生成148.27 tok/s,2bit基线132.13,体积205.5MB对256.6MB。

设置指标结果对照
HY-1.8B-2Bit八项平均63.18FP16 67.15 / INT4 63.31
DeepSeek-R1 W4A8-FP8AIME 202488.67FP8-Block 88.67
Qwen3-8B Eagle3吞吐 tok/s257.52原版 151.81
Stem / Qwen3-8BLongBench均分31.64稠密32.01 / FlexPrefill 28.55
IDPruner留10%AI2D / ChartQA75.16 / 62.48未剪枝 82.48 / 83.68

LeptoQuant把Hunyuan-4B-Instruct的AIME 2024从FP8的66.70拉回76.66(BF16是78.30),但Hunyuan-2B的AIME 2025从37.00掉到36.00,不是处处回血。Eagle3在Qwen3-32B上从43.32提到74.10 tok/s,平均接受长度约1.91;表格全部是batch=1。

为什么重要

这是一份工程报告,新理论不多。2bit数字说明「先训大再压扁」比直接训0.5B划算,端侧想保留推理能力时这条路更现实。投机解码被写成可训、可部署的一等能力,多模态草稿也能进vLLM,比再发一篇接受率论文更有用。稀疏核和剪枝策略跟模型解耦,换算法主要改配置。

PTQ和Eagle3草稿权重已经在Hugging Face上。1.25bit和2bit仍然要QAT,不是一键校准。

局限与存疑

报告几乎没有Limitations节。结论写「4倍端侧加速」,正文里2bit对4bit大约1.5到2倍,3到8倍是对BF16的首token延迟,口径混在一起。Sherry的精度数字来自LLaMA-3.2的1B/3B,不是混元1.8B。Eagle3全是单请求,服务端高并发时草稿收益会缩。IDPruner在90%压缩下ChartQA仍从83.68掉到62.48,剪枝第一不等于无损。1.25bit端侧翻译440MB写在姐妹论文Hy-MT2里,这篇只给方法接口。

术语

原文与代码

社区讨论

相关论文

全部论文解读