MLX-Serve 26.10.1 发布:Qwen3.8 27B 推理提速最高 66%
TheMoonMidas · x · 2026-10-01
MLX-Serve 发布 26.10.1 版本,重点提升推理速度且输出与上一版字节级一致(覆盖 18 个模型)。
- 投机解码加速:Qwen3.8 27B + drafter 在 M5 Ultra 上提升 66%、M4 Max 提升 28%、M1 Pro 提升 37%
- Qwen Flash Next:M4 Max decode +11%,M5 Ultra prefill +51%(最高约 5400 PP)
- Gemma 4、Qwen、LFM2.5、Spark、Bonsai 2 全部提速
- 新特性:GGUF 模型改用自研 MLX 引擎(Zig + Metal 编写,实验性)替代 llama.cpp 回退;支持直接运行 Sushi 格式 Flash Next 包;Qwen-Image 2.1 支持指令改图;投机解码默认对所有支持的模型开启
「Infra」频道最新
- Gradium 发布最快 TTS:首段音频延迟仅约 50ms — mattturck · 2026-10-02
- 工程师观察:Gemini 4 Argon 正被用于跨数据中心集群优化 — rakyll · 2026-10-02
- Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展 — CatAstro_Piyush · 2026-10-02
- HBM 将吞下 22% DRAM 晶圆,内存成 AI 算力的最短板 — aronchick · 2026-10-02
- 视频解析:Google 的 AI 芯片能否击败 Nvidia? — Ill_Vegetable169 · 2026-10-02
- GB300 NVL72 实测:仅调 FP8 KV cache 与 GPU 分配,吞吐最高提升 64% — ryanshrout · 2026-10-02