Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型
HamsterResearch 团队正为即将发布的 Qwen3.8-Flash-Next 构建定制 pMLX 引擎,支持一次性下载 bf16 分层模型并按需动态量化(bf16/q8/q4/q3)、NVMe 流式解码与专家剪枝。实测显示,在 M1 Pro(64GB RAM)上以 0.75x 内存限制、Q4 量化运行时,256k 上下文仍可达每秒 45 token,12GB 显存即可跑代码任务。
2026-09-01 ~ 2026-09-02 · 3 条相关
- Qwen3.8 模型 pMLX 引擎实测:12GB 显存跑代码 — EyalToledano · 2026-09-01
- Qwen 3.8 将推新引擎:支持动态量化与 NVMe 流式 — MgkMshrmBrkfst · 2026-09-01
- 实测 M1 Pro 跑 Qwen 3.8:256k 上下文仍可达 45 tok/s — EyalToledano · 2026-09-02