96GB 内存跑 Qwen3.8-Next-Flash:n-gram 表拆到 SSD 才是解法
Iory1998 · reddit · 2026-08-30
一位拥有双 5070 Ti + 3090(40GB VRAM)和 96GB RAM 的用户,分享在本地跑 Qwen3.8-Next-Flash Q4 量化的踩坑经历:
- unsloth 量化版跑不动:Q4KXL(105GB)和 IQ4XS(90GB)把 56B 的 n-gram 表一起打包进权重文件,全部加载进内存后加上 KV cache,长对话到 60K100K token 就会让 llama.cpp 静默崩溃,且速度只有 12-14 t/s。
- AtomicChat 构建是关键差异:它把 n-gram 表拆成独立分片留在 SSD 上,快速内存只需约 54GB。该表每个 token 仅被哈希稀疏访问约 2.7KB,放 SSD 几乎零成本。
- 实测效果:217K token 的真实对话从头到尾无崩溃跑完,可塞满整个 256K 上下文,速度提升到 22 t/s;prefill 仍受硬件限制,220K 上下文需约 18 分钟处理。
- 趣闻:这个方案还是 DeepSeek 模型在他机器上跑性能基准时作为"最后备选"建议的。作者提醒无法保证量化质量与 unsloth 版完全一致。
「Infra」频道最新
- Grok Bot 提供云端 Debian 桌面环境 — tristanbob · 2026-08-30
- Token 定价经济学:缓存与推理如何影响算力成本 — AccBalanced · 2026-08-30
- NVIDIA 新驱动优化 ComfyUI 与 LTX-2.5 性能 — PixWizardry · 2026-08-30
- DLSS 5 视频播放器实测:3090 Ti 运行缓慢 — fallengt · 2026-08-30
- 数据中心助推美国再工业化:从税收到就业的全面利好 — GavinSBaker · 2026-08-30
- 越南 OneNexus 量化 GLM-5.3 至 MXFP4 — xiaosun86 · 2026-08-30