Qwen3.6-27B 量化版先测权重组再压缩

enginetown · reddit · 2026-07-28

作者发布了 Qwen3.6-27B-Calibrated,做法不是粗暴地给整个模型统一量化位宽,而是逐个 weight group 测试哪些部分可以压缩、哪些部分一压就坏。

他用 general、code、math 和 tool calling 提示词做 KL divergence 测试,发现质量断崖大约出现在每权重组 3.5–3.9 bit 之间,而且最先受影响的通常是工具调用能力。最终提供了三个版本:Bedrock 13.26GB、Tightrope 12.53GB、Gambit 10.94GB。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →