Cloudflare 大规模部署 Kimi 和 GLM 的显存优化实战
arpit_bhayani · x · 2026-08-05
Cloudflare 近期发布了其大规模运行 Kimi K2.6 和 GLM 5.2 模型的工程实践博客。对于这类长上下文大模型,最先耗尽 GPU 显存的往往不是模型权重,而是 KV Cache。
为了提升并发并降低成本,Cloudflare 采用了三项核心技术:
- KV Cache 量化:将 Kimi K2.6 的缓存从默认的 BF16 降至 FP8 精度,直接将显存占用减半。
- 模型权重压缩:进一步压缩模型体积以腾出空间。
- 共享缓存保护:在并发量提升的共享硬件环境下,确保缓存的安全与稳定。
底层推理框架方面,团队选用并深度参与开发了开源框架 SGLang,认为其提供了目前市场上最佳的推理性能。
所属事件:Cloudflare 详解大规模运行 Kimi 与 GLM 显存优化(4 条相关)→
「Infra」频道最新
- GPU 同样的算力四种卖法:Nebius 现货定价背后的基建经济学 — demian_ai · 2026-09-22
- Tata Elxsi 用 AWS 打造 IRIS:边缘过滤削减 70-80% 上云帧量 — AWS ML Blog · 2026-09-22
- bitsandbytes2 略延期:零操作"懒压缩"加动态专家换入,逼近无限 KV cache — Tim_Dettmers · 2026-09-22
- 迭代敏感性探测:Dettmers 解释如何逐层逼近模型压缩崩溃边界 — Tim_Dettmers · 2026-09-22
- Tim Dettmers 发布运行时动态压缩框架,实现 1.5-2.0 bit 高质量压缩 — Tim_Dettmers · 2026-09-22
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22