体积暴降 91%!Unsloth 实现 Qwen3.8 本地运行
danielhanchen · x · 2026-08-13
Unsloth AI 宣布通过全新的 Dynamic 1-bit 量化技术,成功将庞大的 Qwen3.8-2.4T-A95B 模型从 4.9TB 压缩至 397GB(体积缩小 91%),使其能够在本地设备上运行。
- 量化突破:通过选择性量化层并减少码本条目(降至 1.1875 bits per weight),在大幅缩减体积的同时保留了模型精度,适用于大模型的后训练量化(PTQ)。
- 硬件要求:压缩后的模型可在 410GB+ 的 RAM/VRAM 环境下运行,用户可通过 Unsloth Desktop 或 llama.cpp 部署。
- 模型能力:Qwen3.8 包含视觉和思考能力,支持 256K 上下文(最高可达 1M tokens),其性能可与 GPT-5.6 Sol 媲美。
所属事件:Unsloth 推出 Qwen3.8 本地部署指南(2 条相关)→
「Infra」频道最新
- 推演 DeepSeek V4:超低 API 成本与 SSD KV Cache 革命 — Xianbao_QIAN · 2026-08-13
- Vercel AI Gateway 零加价上线 Grok 与 DeepSeek 模型 — brandon_galang · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 实测:单台 DGX Spark 跑 124B 模型达 38.7 tok/s — AcanthisittaOk1699 · 2026-08-13
- 仅 32G 内存能否跑得动 MiniMax H3? — Puzzleheaded_Emu8419 · 2026-08-13
- 80张RTX 5090跑满Kimi K3全量模型,Bittensor网络提供半价平替API — markjeffrey · 2026-08-13