Qwen3.6-27B 量化版先测权重组再压缩
enginetown · reddit · 2026-07-28
作者发布了 Qwen3.6-27B-Calibrated,做法不是粗暴地给整个模型统一量化位宽,而是逐个 weight group 测试哪些部分可以压缩、哪些部分一压就坏。
他用 general、code、math 和 tool calling 提示词做 KL divergence 测试,发现质量断崖大约出现在每权重组 3.5–3.9 bit 之间,而且最先受影响的通常是工具调用能力。最终提供了三个版本:Bedrock 13.26GB、Tightrope 12.53GB、Gambit 10.94GB。
「Infra」频道最新
- Kimi K3 推理需 1.4TB 显存,远超 96GB RTX PRO 6000 — HanchungLee · 2026-07-28
- 一条 Kimi-k3 段子把年费和自建成本拉到百万级 — HarveenChadha · 2026-07-28
- 冻结 12B 通过验证记忆复用答案,零 token 运行 — Corbenci · 2026-07-28
- OpenAI 预计 7500 亿美元算力投入,Anthropic 租算力策略承压 — remybigot · 2026-07-28
- AMD、SGLang 和 Moonshot 联动交付,芯片战转向基础设施 — AnushElangovan · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28