Qwen 3.8 Flash 结合 SGLang 实现零损耗 SSD 卸载
Easy_Werewolf7903 · reddit · 2026-08-29
Reddit 用户分享了 Qwen 3.8 Flash 模型在 SGLang 框架下的新用法:将 Next ngram look up table(下一级 n-gram 查找表)卸载到 SSD 并流式传输。该方案据称在保持性能无损的前提下大幅降低了显存占用,用户对此表现出惊讶并寻求更多实测反馈。
「Infra」频道最新
- Tenstorrent Quietbox 2 到货:256G 内存、128G 互联 GDDR — SashaUsesReddit · 2026-08-29
- DeepSeek 退款劝退用户?V4 贵于 GLM-5.3 引争议 — teortaxesTex · 2026-08-29
- EDA 工具文件可压缩性差,竟支撑起一家 SaaS 公司 — ai · 2026-08-29
- 工会支持数据中心建设,强调谈利益而非一味抵制 — apples_jimmy · 2026-08-29
- 首届 vLLM 大会收官:演讲满场后屋顶酒会,AMD 联合主办 — vllm_project · 2026-08-29
- AtomicChat量化版Qwen3.8-Flash-Next实测:内存占用从106GB降至65GB — tolitius · 2026-08-29