MLX-Serve 新版发布:M4/M5 Max 上 Qwen Flash 跑出 100+ tok/s

TheMoonMidas · x · 2026-09-17

MLX-Serve 26.9.3 发布,号称 Mac 本地运行模型最快的引擎,支持 LLM、视频、图像、声音克隆和音乐生成。作者 ddalcu 表示 Qwen Flash Next 在 M4/M5 Max 上突破 100 tok/s,prefill 速度也非常可观。当前版本定位为 beta,下个版本将专注于打磨和重构。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →