oMLX 0.6.3 发布:Qwen 与 GLM 闪存模型支持,解码提速 160%

HankYeomans · x · 2026-08-28

oMLX 0.6.3 发布,新增对 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 的一流支持,二者均兼容 oQe 量化。Qwen3.8-Flash-Next 可结合 Lightning MTP 与 SSD 卸载,在 M3 Ultra 上将 4K 上下文解码速度从 22.2 提升至 58.1 tok/s,接受率达 96.8%。此外,实验性 GPU+ANE+CPU 路径在稳定性与长提示词质量上均有提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →