腾讯把 770B 混元压到 214 GiB,混合精度平均仅 2.38 bit
OpeningRock8761 · reddit · 2026-10-07
腾讯混元量化团队成员 yghstill 拆解了将 770B 参数的 Hy4 Preview 从约 1.5TB 权重压到 214 GiB 的量化方案,参数量不变,只改权重表示方式。
核心技巧:四权重五比特
- Sherry 算法 + STQ10 存储格式 + MIX-STQ10 混合精度分配。每组四个权重取值 {-d, 0, +d} 且恰有一个零,4 个零位置 × 8 种符号组合共 32 种模式,用 5 bit 编码,合每权重 1.25 bit;每 256 权重共享一个 FP16 scale 后为 1.3125 bit,全模型混合精度平均约 2.38 bit/权重。
按敏感度分配精度
- 77 个 MoE 层、每层 256 个路由专家,专家 gate/up 投影压得最狠:48 个敏感层用 IQ2XXS、29 个不敏感层用 STQ10,同 bit 预算下误差低于全用 IQ1M。
全 Hessian 敏感度评分
- 用完整 Hessian(XXᵀ)捕捉对角线 imatrix 评分漏掉的相关性,两种排序 Spearman 相关仅 -0.115;层按「每字节误差削减」贪心选择。
拟合与运行时
- 纯后训练量化,编码器交替用加权最小二乘拟合 d 与 imatrix 加权误差选零位置,三轮迭代使加权重建误差较原三元编码器降约 90%。
- CUDA kernel 已合入补丁版 llama.cpp,速度与 IQ1M 相当;MRCR 检索几乎不变、数学略降;同 bit 预算下各项评测均领先 UD-IQ1M,MRCR 高出 5 分以上。
「Infra」频道最新
- Forbes:Fireworks、OpenRouter 等开放模型生态正拉低 AI 成本 — karlfreund · 2026-10-07
- Actual 发布汇编级 tokenizer toks:比 Hugging Face 快达 151 倍 — markjeffrey · 2026-10-07
- CoreWeave 推出 RL Rollouts:热加载新权重,比重新部署快约 15 倍 — _ScottCondron · 2026-10-07
- Mistral 用 3800 块 Grace Blackwell GPU 在欧洲训练 ML4,新集群即将上线 — rakyll · 2026-10-07
- ANVIL III 优化器宣称降低预训练成本 62%,称超越 Muon — kellerjordan0 · 2026-10-07
- H100 旧卡并不贬值:现货服务器极度稀缺,买家一机难求 — ns123abc · 2026-10-07