Google 论文:量化小模型冷启动 55-70% 时间耗在加载权重

Google 发表论文,系统实测了量化小型语言模型在 Cloud Run 无服务器 CPU 上的冷启动表现。核心发现是模型加载占冷启动延迟的 55%–70%,瓶颈在于把权重搬进内存而非生成 token 本身。这意味着优化 serverless 场景下的小模型推理,关键在于改进权重加载与内存管理,而非单纯提升计算性能。

2026-09-24 ~ 2026-09-24 · 2 条相关

另有 1 条近重复转述:rohanpaul_ai