Mac 端 Qwen 3.8 27B 提速实测:改用 Dflash2 后达 113 TPS

TheMoonMidas · x · 2026-08-25

开发者 @TheDavidTai 报告了在 Mac 上优化 Qwen 3.8 27B 模型推理速度的成果。通过将原有的 MTP 配置切换为 adaptive Dflash2,并移植 mlx.fast 的改进,模型在 1024 token 的 Python 提示词下达到了 113 TPS 的速度。基准测试覆盖 1k 到 128k 的上下文范围,整体比之前最快配置平均提速约 20%(10% 来自 mlx.fast,另 10% 来自 Dflash2)。作者指出 Dflash2 在多数情况下优于 MTP,但在长思维链(Long CoT)场景下可能例外。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →