zml_ai 编译优化:模型冷启动从 45 分钟缩至 3 分钟

steren · x · 2026-10-12

开发者 steren 报告,将推理服务从 vLLM 迁移到 @zmlai 后,冷启动时间从 45 分钟降到 3 分钟。被引用的 ZML 创始人 @steeve 透露,这是团队在 llmd 发布前后持续优化编译时间(compilation times)的成果——vLLM 长达 45 分钟的启动时间对服务部署是显著痛点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →