pMLX 优化 Qwen 与 GLM 模型:专家换页技术实现 37GB 内存运行

EyalToledano · x · 2026-08-29

文章介绍了 pMLX 项目在 Apple Silicon 上的最新进展,重点优化了 Qwen3.8-Flash-Next 和 GLM-5 等大模型(180B-300B 级别)的推理性能。

关键优化与技术:

资源发布:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →