M4 Max 跑 Qwen3.8-27B:长上下文下 oMLX 胜出,前缀缓存最提速

vitordeas · reddit · 2026-08-30

在 M4 Max (128GB) 上测试了 5 种运行时/量化栈运行 Qwen3.8-27B 在 32K-256K 上下文的速度。

核心结论:

技术细节:测试涵盖 oMLX (AWQ/oQ8e)、MTPLX (原生 MTP)、mlx-dspark (DFlash2 起草器)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →