mlx-vlm 多轮延迟降到0.25秒
WesEklund · x · 2026-07-11
作者表示自己为开源本地 AI 项目做了贡献,把 mlx-vlm 的多轮 agent warm latency 从约 72 秒 降到约 0.25 秒,提升约 290 倍。
他解释了原本已有两项优化:
- Prefix caching / APC:复用长上下文中的重复计算
- KV cache quantization:降低显存占用,让更大的模型能在 Mac 上跑
但这两者此前互相冲突:开启 KV 量化后,prefix caching 基本失效。现在这一限制被打通了,因此可以同时兼顾 多轮速度 和 内存占用。作者还表示新版本“很快会发布”。
所属事件:mlx-vlm缓存修复使智能体延迟降290倍(4 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11