Google 论文:量化 LLM 冷启动延迟 55–70% 耗在加载权重而非推理

rohanpaul_ai · x · 2026-09-24

Google 新论文发现,在 serverless CPU 上运行小型量化 LLM 时,55–70% 的冷启动延迟来自模型加载——瓶颈在于把权重搬进内存,而不是生成 token 本身。一个直接可用的结论:给同一模型 8GB 而非 4GB 的 Cloud Run 内存,可解锁约 2 倍 CPU,warm 推理时间几乎减半。

所属事件:Google 论文:量化小模型冷启动 55-70% 时间耗在加载权重(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →