Google 论文:量化小模型冷启动 55-70% 延迟耗在加载权重

rohanpaul_ai · x · 2026-09-24

Google 发表论文,系统实测了量化小语言模型在 Cloud Run 无服务器 CPU 上的冷启动表现。

核心发现:

实验范围: 5 个模型(270M-3.8B)、4/8 GiB 两档内存、Q2K 到 Q80 五种 GGUF 量化格式,基于 llama.cpp。对想在无服务器平台部署小模型的开发者是实用的选型参考。

所属事件:Google 论文:量化小模型冷启动 55-70% 时间耗在加载权重(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →