MTPLX 框架加速 Qwen 模型推理 2 倍

koc_Z3 · reddit · 2026-08-29

MTPLX 框架声称可在 Apple Silicon 上显著加速 Qwen 模型。在 M1 Max 64GB 设备测试中,Qwen2.5-27B (Q4) 解码速度达 21 TPS,预填充提速至 83 TPS(峰值 111),实现约 2 倍加速;Qwen2.5-35B 预填充峰值达 623 TPS。框架支持自动调优草稿深度,并能将基础模型转换为 MLX 就绪的 MTP 模型。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →