MLX-Serve 27B 推理提速:分支猜测一次验证,较上版快 32%

TheMoonMidas · x · 2026-09-27

开发者 ddalcu 介绍 MLX-Serve 的新优化:借鉴 TensorFold 的技巧,对下一个 token 做多个分支猜测并在一次前向中全部验证,从而在 M4 Max 上跑 27B 模型时,生成速度比 TensorFold 快最多 20%,比 26.9.5 版本快 32%。这是苹果 MLX 生态在本地推理吞吐上的又一实用进展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →