oMLX 0.7.0 发布:长上下文解码提速 50%,重写内存守护
pcuenq · x · 2026-10-01
Mac 端 MLX 推理栈 oMLX 发布 0.7.0,重点提升长上下文与多模型速度:
- 性能对比 rc1(oQ4e、开启 Lightning MTP):
- Qwen3.8-Flash-Next 在 M5 Max、16K 上下文 prefill:1,953 → 2,844 tok/s(+46%)
- Qwen3.8-27B 在 M3 Ultra、64K 上下文 decode:46.9 → 70.3 tok/s(+50%)
- GLM-5.3-Flash 在 M3 Ultra、16K 上下文 prefill:413 → 516 tok/s(+25%)
- 新特性:完全重写的 memory guard,可安全吃满尽可能多的内存;为 GLM-5.3-Flash 加入 DFlash2 支持;Qwen3.8-Flash-Next 通过 vision feature cache 加速连续图像请求;修复 RC 阶段反馈的 ANE prefill、M5 A8 等回归问题。
「Infra」频道最新
- RTX 6000 集群散热实战:出风口对墙、Pro 卡反转避吹主板 — TheZachMueller · 2026-10-01
- Transformers.js 年度成绩单:周下载量从 15 万涨至 370 万 — nicodotdev · 2026-10-01
- 华为 Mate 90 发布:麒麟 9050 Pro 首用 LogicFolding 架构 — ingliguori · 2026-10-01
- A20 标准版疑不用 WMCM 封装,爆料的回应只有三个字:产能不够 — zephyr_z9 · 2026-10-01
- TRL 月训练量破 100 万次,团队瞄准每周百万 — QGallouedec · 2026-10-01
- SlideDP:4 张 RTX 4090 微调 Qwen2.5-72B,吞吐超 FSDP2 11.2% — Ruijia Yang · 2026-10-01