Qwen3.8 模型 pMLX 引擎实测:12GB 显存跑代码

EyalToledano · x · 2026-09-01

Qwen3.8-Flash-Next 即将发布,基于 pMLX 引擎实现 tiered 模型与动态量化。该方案支持 bf16/q8/q4/q3 飞行量化、NVME 流式解码及专家剪枝。实测数据显示:Q3 量化下 12GB 内存最低配置可达 10 tok/s 持续解码;代码编辑任务中,Q4 32k 上下文配置可实现 58 tok/s 持续速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →