mlx-vlm 多轮延迟降到0.25秒

WesEklund · x · 2026-07-11

作者表示自己为开源本地 AI 项目做了贡献,把 mlx-vlm 的多轮 agent warm latency 从约 72 秒 降到约 0.25 秒,提升约 290 倍。

他解释了原本已有两项优化:

但这两者此前互相冲突:开启 KV 量化后,prefix caching 基本失效。现在这一限制被打通了,因此可以同时兼顾 多轮速度 和 内存占用。作者还表示新版本“很快会发布”。

所属事件:mlx-vlm缓存修复使智能体延迟降290倍(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →