pMLX 优化 Qwen 与 GLM 模型:专家换页技术实现 37GB 内存运行
EyalToledano · x · 2026-08-29
文章介绍了 pMLX 项目在 Apple Silicon 上的最新进展,重点优化了 Qwen3.8-Flash-Next 和 GLM-5 等大模型(180B-300B 级别)的推理性能。
关键优化与技术:
- 专家换页(Expert Paging): 全新应用的技术,使 MoE 模型的专家按需从 NVMe 流式传输到内存,而非常驻 RAM。类似 n-gram streaming 的思路应用于 MoE 架构。
- 内存效率: 应用于完整模型且无剪枝,60% 的专家存储在 SSD 上,仅需 37GB 内存即可运行(原帖末尾暗示更低占用)。
- MTP 推理加速: pMLX 使得 MTP(推测解码)在 M4 芯片上变得有利可图,检查 drafter 猜测的成本接近单步,解码速度相比 mlxvlm 翻倍。
资源发布:
- 新增 REAP-288-bf16 + GGUF、MXFP4 和 NVFP4 格式上传至 Hugging Face。
- 正在构建纯 MLX 推理引擎以最大化开源模型性能。
「Infra」频道最新
- 分析英伟达估值:AI支出可持续性与利润率压力 — menhguin · 2026-08-29
- 三星展示LPDDR5X-PIM:内存带宽飙至614GB/s — jedisct1 · 2026-08-29
- Kubernetes 与 TensorFlow Serving 部署模型实战 — Al_Grigor · 2026-08-29
- 无服务器深度学习:在 AWS Lambda 上部署模型 — Al_Grigor · 2026-08-29
- 模型部署实战:FastAPI 与 Docker 云端部署 — Al_Grigor · 2026-08-29
- Firefox 与 Chrome 计划支持 JPEG XL 图像格式 — addyosmani · 2026-08-29