zml_ai 编译优化:模型冷启动从 45 分钟缩至 3 分钟
steren · x · 2026-10-12
开发者 steren 报告,将推理服务从 vLLM 迁移到 @zmlai 后,冷启动时间从 45 分钟降到 3 分钟。被引用的 ZML 创始人 @steeve 透露,这是团队在 llmd 发布前后持续优化编译时间(compilation times)的成果——vLLM 长达 45 分钟的启动时间对服务部署是显著痛点。
「Infra」频道最新
- 中国国资加码华虹:注册资本增至 197 亿元押注成熟制程 — pstAsiatech · 2026-10-12
- AI 需求火爆,住友电木扩产中国与新加坡先进封装材料产能 — pstAsiatech · 2026-10-12
- Local Inference Lab 发布优化 Docker,RTX 6000 Pro/DGX Spark 一键本地跑 GLM-5.3 — TheZachMueller · 2026-10-12
- 旧金山机场惊现 GPU 集群广告:BitDeer 卖 115MW 算力 — firstadopter · 2026-10-12
- Agent 基础设施需要自己的 Kubernetes?Reddit 讨论抽象原语设计 — Disastrous_Gap_6473 · 2026-10-12
- Jetson Orin 上 Gemma4 E4B 提速:fork exllamav3 prefill 达 1136 tok/s — cortexist · 2026-10-12