Cloudflare 详解大规模运行 Kimi 与 GLM 的推理优化
michellechen · x · 2026-08-03
Cloudflare 发布技术博客,分享了在其 Workers AI 上大规模运行 Kimi 和 GLM 等万亿参数模型的底层优化经验。
为了解决这些大型长上下文 MoE 模型的内存受限问题,团队主要采用了三项技术:
- KV 缓存量化:有效减少注意力机制键值对带来的显存占用。
- 模型权重压缩:进一步降低模型加载的内存需求。
- 缓存保护机制:在共享硬件上打包更多请求的同时,防止缓存互相干扰。
此外,所有实验和生产流量均基于开源推理框架 SGLang 运行和基准测试,团队认为 SGLang 目前提供了市场上最佳的推理性能。
「Infra」频道最新
- Cloudflare 启动 Agents Week,Workers 现已支持 gRPC — ritakozlov · 2026-08-03
- Cloudflare 推出 Billable Usage API,提供程序化成本监控 — ritakozlov · 2026-08-03
- Cloudflare Workers 与 Containers 宣布支持 gRPC 及入站 TCP — ritakozlov · 2026-08-03
- Cloudflare 推出 @cloudflare/computer:为每个 Agent 配备专属计算环境 — threepointone · 2026-08-03
- Turso 数据库突破 SQLite 限制,正式支持并发写入 — glcst · 2026-08-03
- Cloudflare 推出开源 Agent 运行时,让智能体按需调度容器与隔离环境 — Cloudflare Blog · 2026-08-03