专用栈逆袭通用框架:原生 MTP 推测解码提速 154%
AccBalanced · x · 2026-09-13
转发的推文列举了三个「专用优于通用」的 Apple Silicon 本地推理案例:
- @antirez 围绕 DeepSeek V4 Flash 专门构建了 DS4/DwarfStar,而不是等待能吸收所有模型优化的通用运行时;
- @Youssofal 的 MTPLX 在 MLX/GGUF/LM Studio 尚不支持时,就把原生 MTP 推测解码带到了 Apple Silicon;
- @ddalcu 的 mlx-serve 展示了原生 MTP 在 Qwen 3.6 35B 上带来约 +154% 提升,基准对比约为 LM Studio 的 2 倍。
作者结论:针对特定模型架构与硬件目标做激进优化,正在明显优于「通用 Purpose 技术栈」,这种专用化趋势随 LLM 发展会越来越重要,呼吁支持这些贡献者。
「Infra」频道最新
- 云 agent 并行 vs 本地 Mac:altryne 称云端跑 agent 才是正解 — altryne · 2026-09-13
- $5000 出 5090 换 M5 Ultra 96GB?带宽 1.8 vs 1.2 TB/s 的纠结 — unchikuso · 2026-09-13
- 开发者用 CUDA 加速 Minecraft 世界生成,并与 Java 版逐位一致验证 — gandamu_ml · 2026-09-13
- 网友喊话华为:做台 1TB 显存的桌面推理盒,摆脱 Nvidia 依赖 — AIFlow_ML · 2026-09-13
- 一个月冒出 5 个专用推理引擎,生态碎片化引争议 — JustinLin610 · 2026-09-13
- Cloudflare CEO:全球知识工作者各跑一个 Agent 需 40 倍 CPU — BenBajarin · 2026-09-13