Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型

HamsterResearch 团队正为即将发布的 Qwen3.8-Flash-Next 构建定制 pMLX 引擎,支持一次性下载 bf16 分层模型并按需动态量化(bf16/q8/q4/q3)、NVMe 流式解码与专家剪枝。实测显示,在 M1 Pro(64GB RAM)上以 0.75x 内存限制、Q4 量化运行时,256k 上下文仍可达每秒 45 token,12GB 显存即可跑代码任务。

2026-09-01 ~ 2026-09-02 · 3 条相关