mlx-vlm缓存修复使智能体延迟降290倍

开源本地AI项目mlx-vlm迎来重大性能优化。一位开发者通过修复长期存在的缓存路径瓶颈,将多轮智能体的热启动延迟从约72秒大幅缩减至约0.25秒,实现了约290倍的显著提升。这一关键工程修复并非依赖更换新模型,而是有效解决了多轮智能体运行时的性能痛点,为开源本地AI生态做出了重要贡献。

2026-07-11 ~ 2026-07-12 · 4 条相关

另有 2 条近重复转述:WesEklund · WesEklund