GKE Pod snapshots 将 AI 推理冷启动缩短 89%,70B 模型 37 秒加载
rseroter · x · 2026-09-22
- Google Cloud 推出 GKE Pod snapshots,可保存工作负载运行状态(含 CPU/GPU 内存),并按需恢复,替代完整重启。
- 冷启动最高降低 89%:70B 参数模型 37 秒即可加载,8B 模型仅需 15 秒。
- 背景痛点:推理服务器需将数 GB 权重载入 GPU 内存,通常耗时数分钟;agentic 工作负载(代码执行、computer use)还需为每个请求快速启动隔离沙箱,启动延迟拖累体验与自动扩缩容,迫使企业过度配置资源。
- 通过「恢复而非重启」,可显著减少过度配置,让基础设施按需快速扩缩。
「Infra」频道最新
- 应对 AI 爬虫流量:Turnstile 之外的 Cloudflare AI Labyrinth 方案 — fforres · 2026-09-22
- cHHillee:软件护城河难敌 RSI,ML 基建价值在需求聚合 — PatrickToulme · 2026-09-22
- 树莓派固件锁定原始内存容量,禁止用户换更大 RAM — ngxson · 2026-09-22
- fal 推出 H3 Max:3 秒生成 5 秒前沿级视频,全栈优化揭秘 — gorkem · 2026-09-22
- NVIDIA EPD 分离架构:图像首 Token 最快提速 5 倍 — dl_weekly · 2026-09-22
- 16GB Mac 本地跑 MiniMax H3 生视频:8-10 秒片段约 15-20 分钟 — coberholzer · 2026-09-22