MLX-Serve 26.9.6 发布:M5 Ultra 优化,Qwen3.8 解码达 300+ tok/s

TheMoonMidas · x · 2026-09-26

ddalcu 发布 mlx-serve v26.9.6(由 MLX Core 更名而来),重点针对 M5 Ultra 做本地推理优化。

关键更新:

M5 Ultra 上 Flash Next 混合 4-8 bit 加 --mtp 的峰值:219 tok/s 解码、4 流 227 tok/s、8k prompt prefill 3150 tok/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →