Unsloth 发布 Qwen3.8 本地部署指南,1-bit 量化压缩至 397GB
MaziyarPanahi · x · 2026-08-13
Unsloth 发布了 Qwen3.8 系列模型的本地运行指南。该系列包含具备视觉和思考能力的 27B、2.4T-A95B(总参 2.4T/激活 95B)以及 Max 版本,支持最高 1M tokens 上下文。
针对庞大的参数量,Unsloth 扩展了 llama.cpp 的量化方案,推出全新的 1-bit 数据类型(如 UD-IQ1XXXS)。通过将 codebook 条目减少至 1.1875 bits/weight,2.4T 模型的体积被压缩至 397GB(缩小 91%),使其能在本地运行,且无需量化感知训练 (QAT) 即可保持较好精度。27B 版本则可在 16GB 以上内存设备运行。
所属事件:Unsloth新量化技术让Qwen3.8暴降91%(3 条相关)→
「Infra」频道最新
- 4GB显存硬刚本地Agent:开发者分享极低算力实践 — ComplexHuman26 · 2026-08-13
- Polymarket 数据:今年 AI 泡沫破裂概率仅 15% — Polymarket · 2026-08-13
- YC 新项目 Pacific:用模块化微型数据中心盘活闲置电力 — ycombinator · 2026-08-13
- Lumentum CEO:单两大AI数据中心带宽需求翻倍过去十年总和 — Beth_Kindig · 2026-08-13
- 为何本地模型无法赢得未来?算力与成本双重劣势注定云端胜出 — rseroter · 2026-08-13
- 智能体工程的三层进阶:真正的瓶颈是算力而非大模型 — peterjliu · 2026-08-13