oMLX 0.6.3 发布:Qwen 与 GLM 闪存模型支持,解码提速 160%
HankYeomans · x · 2026-08-28
oMLX 0.6.3 发布,新增对 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 的一流支持,二者均兼容 oQe 量化。Qwen3.8-Flash-Next 可结合 Lightning MTP 与 SSD 卸载,在 M3 Ultra 上将 4K 上下文解码速度从 22.2 提升至 58.1 tok/s,接受率达 96.8%。此外,实验性 GPU+ANE+CPU 路径在稳定性与长提示词质量上均有提升。
「Infra」频道最新
- 纯 MLX 引擎推理提速至 65 tok/s,显存需求减半 — EyalToledano · 2026-08-28
- Nvidia 护城河在规模与供应链锁定 — firstadopter · 2026-08-28
- 观点:Qwen 的 n-gram 技术将刺破 AI 泡沫 — Acrobatic_Stress1388 · 2026-08-28
- 担忧:若 Nvidia 收购 Llama.cpp 和 HF — Hannibalj2ca · 2026-08-28
- Microsoft Foundry 推 AI Gateway,统一管控流量与配额 — davemccollough · 2026-08-28
- Autonomous 推出双卡 RTX 5090 工作站,26100 美元起 — dee_hw · 2026-08-28