Unsloth 发布 Qwen3.8 本地部署指南,1-bit 量化压缩至 397GB

MaziyarPanahi · x · 2026-08-13

Unsloth 发布了 Qwen3.8 系列模型的本地运行指南。该系列包含具备视觉和思考能力的 27B、2.4T-A95B(总参 2.4T/激活 95B)以及 Max 版本,支持最高 1M tokens 上下文。

针对庞大的参数量,Unsloth 扩展了 llama.cpp 的量化方案,推出全新的 1-bit 数据类型(如 UD-IQ1XXXS)。通过将 codebook 条目减少至 1.1875 bits/weight,2.4T 模型的体积被压缩至 397GB(缩小 91%),使其能在本地运行,且无需量化感知训练 (QAT) 即可保持较好精度。27B 版本则可在 16GB 以上内存设备运行。

所属事件:Unsloth新量化技术让Qwen3.8暴降91%(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →