Mac M4 Max 运行 Qwen 3.8 27B:代码生成达 72 tok/s

TheMoonMidas · x · 2026-08-22

开发者分享在 Mac Studio M4 Max 上优化运行 Qwen 3.8 27B 模型的方案。通过使用 oMLX 0.6.3rc2 框架,结合 ANE (Apple Neural Engine) 进行 Prefill 加速和原生 Multi-Token Prediction (MTP, k=3) 技术,实现了显著的性能提升。实测数据显示:

相比之前的最佳方案,解码速度提升约 11%。所有测试均基于本地环境,无云端调用,并在 GitHub 开源了具体的 Benchmark 数据和配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →