AtomicChat量化版Qwen3.8-Flash-Next实测:内存占用从106GB降至65GB
tolitius · reddit · 2026-08-29
Reddit用户测试了AtomicChat的Qwen3.8-Flash-Next GGUF量化版本,在M4 Max 128GB Studio上运行,内存占用从106GB降至65GB,冷启动prefill速度约500 t/s。该量化利用llama.cpp mmap和分页PLE表,显著降低资源需求。同时提到oMLX有PR优化PLE SSD卸载,冷prefill速度提升近3倍。
「Infra」频道最新
- DeepSeek 退款劝退用户?V4 贵于 GLM-5.3 引争议 — teortaxesTex · 2026-08-29
- EDA 工具文件可压缩性差,竟支撑起一家 SaaS 公司 — ai · 2026-08-29
- 工会支持数据中心建设,强调谈利益而非一味抵制 — apples_jimmy · 2026-08-29
- Qwen 3.8 Flash 结合 SGLang 实现零损耗 SSD 卸载 — Easy_Werewolf7903 · 2026-08-29
- 首届 vLLM 大会收官:演讲满场后屋顶酒会,AMD 联合主办 — vllm_project · 2026-08-29
- Cerebras 创始人:AI 加速硬件演进,行业正自我重塑 — Sethwinterroth · 2026-08-29