Google 论文:量化小模型冷启动 55-70% 延迟耗在加载权重
rohanpaul_ai · x · 2026-09-24
Google 发表论文,系统实测了量化小语言模型在 Cloud Run 无服务器 CPU 上的冷启动表现。
核心发现:
- 模型加载占冷启动时间的 55-70%,瓶颈在于把权重搬进内存,而非推理本身
- 8 GiB 内存档位隐藏 2× vCPU 优势,几乎可将 warm 推理时间减半
- Q4KM 量化在延迟、吞吐与质量(以 WikiText-2 困惑度验证)上达到 Pareto 最优
- 基于三个预测变量建立了 R²=0.97 的延迟模型,并给出盈亏平衡成本分析
实验范围: 5 个模型(270M-3.8B)、4/8 GiB 两档内存、Q2K 到 Q80 五种 GGUF 量化格式,基于 llama.cpp。对想在无服务器平台部署小模型的开发者是实用的选型参考。
所属事件:Google 论文:量化小模型冷启动 55-70% 时间耗在加载权重(2 条相关)→
「Infra」频道最新
- Ornn数据:Token价格普跌而GPU租金大涨,价值流向算力持有者 — FinanceYF5 · 2026-09-24
- EPRI 研究:2015-2024 数据中心建设反而小幅拉低美国电价 — Afinetheorem · 2026-09-24
- 模型Token三个月降62%,B200租金反涨50%,算力成最大赢家 — FinanceYF5 · 2026-09-24
- 去中心化GPU云Lium接入21国68座数据中心,闲置分钟也付费 — markjeffrey · 2026-09-24
- 一条命令在 Hetzner 部署免维护 K8s,开源项目 3.9k 星 — BLUECOW009 · 2026-09-24
- 高通、三星、Cerebras、d-Matrix 齐押计算堆叠 3D-DRAM — AccBalanced · 2026-09-24