AtomicChat量化版Qwen3.8-Flash-Next实测:内存占用从106GB降至65GB

tolitius · reddit · 2026-08-29

Reddit用户测试了AtomicChat的Qwen3.8-Flash-Next GGUF量化版本,在M4 Max 128GB Studio上运行,内存占用从106GB降至65GB,冷启动prefill速度约500 t/s。该量化利用llama.cpp mmap和分页PLE表,显著降低资源需求。同时提到oMLX有PR优化PLE SSD卸载,冷prefill速度提升近3倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →