MLX-Serve 26.9.6 发布:M5 Ultra 优化,Qwen3.8 解码达 300+ tok/s
TheMoonMidas · x · 2026-09-26
ddalcu 发布 mlx-serve v26.9.6(由 MLX Core 更名而来),重点针对 M5 Ultra 做本地推理优化。
关键更新:
- M5 Ultra 优化:Qwen3.8 Flash Next 解码最高约 243-300+ tok/s,prefill 达 3362 tok/s;MoE 融合内核带来 +14% 验证提升,多流融合验证在 4 流时 +13%
- Laya typed decisions:新增 POST /v1/decisions 端点,支持本地 JEV
- MTP 草稿机制:当回复复制对话内容时从对话本身起草,文件重写与编辑解码提速 1.3-1.5x(默认开启,MLXSERVEMTPLOOKUP=0 关闭)
- GDN 层合并为单次 GPU dispatch,所有 Mac 都有小幅提升
- 修复媒体与 preservethinking 处理,UI 更新
M5 Ultra 上 Flash Next 混合 4-8 bit 加 --mtp 的峰值:219 tok/s 解码、4 流 227 tok/s、8k prompt prefill 3150 tok/s。
「Infra」频道最新
- SemiAnalysis 探测 DeepSeek V4.1 Flash Engram 门控,揭示文本模式激活规律 — teortaxesTex · 2026-09-26
- 开源 FreeToken:游戏 PC 本地跑 290B+ 前沿 MoE 模型,已 13.8k Star — solyarisoftware · 2026-09-26
- 哥大报告:美国 AI 算力扩张需每 GPU 小时 5.5 美元营收支撑 — rohanpaul_ai · 2026-09-26
- SemiAnalysis 免费拆解 Apple M6 与台积电 N2,披露 GAAFET 工厂细节 — AIFlow_ML · 2026-09-26
- llama.cpp 新 PR:VNNI 让 CPU prompt 处理提速 3-7 倍 — jacek2023 · 2026-09-26
- AxonDAO 推出 AxonOS:浏览器里的 GPU 原生科研桌面 — melnykowycz · 2026-09-26