mlx-vlm 集成 LFM2.5 推测解码:M5 Max 提速 3.7 倍
helloiamleonie · x · 2026-08-22
mlx-vlm 项目宣布在 v0.6.16 版本中集成 Liquid AI 的 LFM2.5 DSpark 模型。通过精确的推测解码,该实现在 M5 Max 芯片上实现了最高 3.7 倍的生成速度提升,且保证了零输出漂移。PR 细节显示,团队通过共享 Metal GEMV 核和混合缓存回滚机制,确保了 MoE 和密集模型验证的精确性。
「Infra」频道最新
- MCP 并非取代 API,而是改变了 API 的设计受众 — kush_patil · 2026-08-22
- Qwen3.8-27B 推出 DFlash2 投机解码 GGUF 量化版 — incoai · 2026-08-22
- Woolly 让 Qwen3-8B 数理解码提速 2-3 倍 — bosmeny · 2026-08-22
- 观点:禁数据中心将致未来二十年经济低迷 — GabGarrett · 2026-08-22
- Vercel修复TLS碎片问题,所有网站恢复正常 — uwukko · 2026-08-22
- 观点:数据中心工人和居民应获得代币分红 — beffjezos · 2026-08-22