MTPLX 框架加速 Qwen 模型推理 2 倍
koc_Z3 · reddit · 2026-08-29
MTPLX 框架声称可在 Apple Silicon 上显著加速 Qwen 模型。在 M1 Max 64GB 设备测试中,Qwen2.5-27B (Q4) 解码速度达 21 TPS,预填充提速至 83 TPS(峰值 111),实现约 2 倍加速;Qwen2.5-35B 预填充峰值达 623 TPS。框架支持自动调优草稿深度,并能将基础模型转换为 MLX 就绪的 MTP 模型。
「Infra」频道最新
- MacBook M5 Max 跑 Qwen 350K 上下文实测 — Artistic_Okra7288 · 2026-08-30
- 开发者 Azure Linux 4.0 桌面化实测:预装 PowerShell 与 Copilot — unixterminal · 2026-08-30
- 黄仁勋:先造技术再找问题,算力统一物理与生物 — r0ck3t23 · 2026-08-30
- 如何从零构建 LLM 推理引擎:拆解 5 层架构 — glenbeer · 2026-08-30
- 华勤预计 2026H2 超级节点收入破百亿,三大云厂商下巨额订单 — zephyr_z9 · 2026-08-30
- 英伟达日赚 10 亿美元,几年前的商业神话照进现实 — shauntrennery · 2026-08-30