Cloudflare 详解大规模运行 Kimi 与 GLM 显存优化

Cloudflare 发布技术博客,分享了在其 Workers AI 平台上大规模运行 Kimi K2.6 和 GLM 5.2 等万亿参数模型的底层优化经验。针对长上下文 MoE 模型,团队发现 KV 缓存往往比模型权重更早耗尽 GPU 显存。为此,Cloudflare 采用了 FP8 与 INT4 量化等核心策略,结合 SGLang 部署方案,成功将并发处理能力翻倍,实现了高效的推理优化。

2026-08-03 ~ 2026-08-05 · 4 条相关

另有 2 条近重复转述:michellechen · arpit_bhayani