MLX-Serve 新版发布:M4/M5 Max 上 Qwen Flash 跑出 100+ tok/s
TheMoonMidas · x · 2026-09-17
MLX-Serve 26.9.3 发布,号称 Mac 本地运行模型最快的引擎,支持 LLM、视频、图像、声音克隆和音乐生成。作者 ddalcu 表示 Qwen Flash Next 在 M4/M5 Max 上突破 100 tok/s,prefill 速度也非常可观。当前版本定位为 beta,下个版本将专注于打磨和重构。
「Infra」频道最新
- TNG 拆解 OpenRouter 神秘模型 Union Alpha:疑似多模型混合路由器 — airesearch12 · 2026-09-17
- Strix Halo 上 ROCm 反超 Vulkan:解码最快 41.9 tok/s,提速 28%-47% — QuixiAI · 2026-09-17
- 4 张 AMD V620 跑 Qwen3.8-Flash,编码生成 70+ tok/s — Thin_Pollution8843 · 2026-09-17
- 只重训 fp16 scale,让 3-bit GGUF 更贴近 BF16 原模型 — ZenZombie117 · 2026-09-17
- 强化学习训练成本基准上线,高级 RL 费用首次有参照 — teortaxesTex · 2026-09-17
- PyTorch 大会公布议程:torch.compile 与自定义内核成焦点 — PyTorch · 2026-09-17