Cloudflare 部署大模型显存优化:FP8 与 INT4 让并发翻倍
arpit_bhayani · x · 2026-08-05
作者解析了 Cloudflare 大规模部署 Kimi K2.6 和 GLM 5.2 的博客,指出KV cache 往往比模型权重更早耗尽 GPU 显存。
核心优化策略与权衡:
- Kimi K2.6:将 KV cache 从默认的 BF16 降为 FP8 精度,存储减半,使单卡最大上下文从 68 万 tokens 增至 137 万。虽然 FP8 因类型转换导致单 token 生成略慢(5-9%),但显存占用减半使得并发上限从 32 提升至 64,吞吐量峰值提升 41%。
- GLM 5.2:进一步将模型权重从 FP8 压缩至 INT4,使单卡显存占用从 88GB 降至 52GB。
基准测试表明,这些精度下降几乎不影响模型质量,FP8 KV cache 与 BF16 得分相差不到 1 分,INT4 权重与 FP8 得分差距也维持在 0.8 分以内。
所属事件:Cloudflare 详解大规模运行 Kimi 与 GLM 显存优化(4 条相关)→
「Infra」频道最新
- 本地跑 H3 视频:15 秒生成 5 分钟零成本,对比平台每次约 0.6 美元 — AIandDesign · 2026-09-22
- MotherDuck 文本分类提速 50 倍,成本降至 1% — josh_wills · 2026-09-22
- Google 月处理 3200 万亿 token 约耗 12GW,三年内或撞能源墙 — victor_explore · 2026-09-22
- M5 Ultra 256GB 首测 Mimo2.6-Flash:32K 上下文 49 tok/s — bakawolf123 · 2026-09-22
- TRL 异步 GRPO 支持 LoRA,训练 500 步耗时从 3.5 小时降至 53 分钟 — SergioPaniego · 2026-09-22
- GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速 — pcuenq · 2026-09-22