oMLX 0.6.3rc1 发布:ANE Tuner 速度倍增,支持 DFlash 2
alexcovo_eth · x · 2026-08-20
oMLX 0.6.3rc1 候选版发布,主要改进包括:
- ANE Tuner V2:通过预测最佳分割策略,将全模型验证运行从 11 次降至最多 3 次,大幅调优速度。
- 更广的量化支持:Q5、Q6、Q8 现已支持混合 ANE/GPU 路径。在 M3 Ultra 上运行 Qwen3.8-27B,Q6 prefill 速度从 446 提升至 561 tok/s。
- DFlash 2 支持:端到端支持 DFlash 2。在 M3 Ultra 上测试 Qwen3.8-27B-DFlash2,解码速度在 4K-32K 上下文下提升约 1.3-1.4 倍。
- 其他改进:增强分布式集群可靠性,修复长对话中的前缀缓存复用问题等。
「Infra」频道最新
- 延迟 1.5 年损毁 8.9% 价值,AI 数据中心速度为王 — Beth_Kindig · 2026-08-20
- 澄清:OpenAI 20% 算力用于监测是误解 — sjgadler · 2026-08-20
- SkyPilot 联手 VAST Data 等举办 AI 基础设施聚会 — skypilot_org · 2026-08-20
- PolymathicAI 发布 15TB 物理模拟数据集 The Well — tom_doerr · 2026-08-20
- 实测:文件系统检索比 MCP 快百倍 — ml_guy1 · 2026-08-20
- Addy Osmani 谈工程角色解绑与 AI Agent — addyosmani · 2026-08-20