Cloudflare 部署大模型显存优化:FP8 与 INT4 让并发翻倍
arpit_bhayani · x · 2026-08-05
作者解析了 Cloudflare 大规模部署 Kimi K2.6 和 GLM 5.2 的博客,指出KV cache 往往比模型权重更早耗尽 GPU 显存。
核心优化策略与权衡:
- Kimi K2.6:将 KV cache 从默认的 BF16 降为 FP8 精度,存储减半,使单卡最大上下文从 68 万 tokens 增至 137 万。虽然 FP8 因类型转换导致单 token 生成略慢(5-9%),但显存占用减半使得并发上限从 32 提升至 64,吞吐量峰值提升 41%。
- GLM 5.2:进一步将模型权重从 FP8 压缩至 INT4,使单卡显存占用从 88GB 降至 52GB。
基准测试表明,这些精度下降几乎不影响模型质量,FP8 KV cache 与 BF16 得分相差不到 1 分,INT4 权重与 FP8 得分差距也维持在 0.8 分以内。
所属事件:Cloudflare 详解大规模运行 Kimi 与 GLM 显存优化(4 条相关)→
「Infra」频道最新
- 「芯片版 OpenRouter」被认为是价值百亿美元级的机会 — mishig25 · 2026-09-06
- NYT 调查:被制裁浪潮集团借美国子公司 Aivres 续购 Nvidia 顶级 AI 芯片 — ShakeelHashim · 2026-09-06
- 开源脚本让旧安卓变身 GPU 加速 Linux 桌面或智能家居服务器 — tom_doerr · 2026-09-06
- 两块"奶奶级"P40 跑出 48 tok/s:老显卡llama.cpp 调优实录 — Jumpy-Operation-4615 · 2026-09-06
- 3090+魔改64GB CMP 170HX 双卡跑 H3 频遇 OOM,求固定显存分配方案 — JustinPooDough · 2026-09-06
- Baseten 工程师出书《Inference Engineering》附学习资源清单 — kmeanskaran · 2026-09-06