mlx-vlm 集成 LFM2.5 推测解码:M5 Max 提速 3.7 倍

helloiamleonie · x · 2026-08-22

mlx-vlm 项目宣布在 v0.6.16 版本中集成 Liquid AI 的 LFM2.5 DSpark 模型。通过精确的推测解码,该实现在 M5 Max 芯片上实现了最高 3.7 倍的生成速度提升,且保证了零输出漂移。PR 细节显示,团队通过共享 Metal GEMV 核和混合缓存回滚机制,确保了 MoE 和密集模型验证的精确性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →