Cloudflare 详解大规模运行 Kimi 与 GLM 的推理优化
michellechen · x · 2026-08-03
Cloudflare 发布技术博客,分享了在其 Workers AI 上大规模运行 Kimi 和 GLM 等万亿参数模型的底层优化经验。
为了解决这些大型长上下文 MoE 模型的内存受限问题,团队主要采用了三项技术:
- KV 缓存量化:有效减少注意力机制键值对带来的显存占用。
- 模型权重压缩:进一步降低模型加载的内存需求。
- 缓存保护机制:在共享硬件上打包更多请求的同时,防止缓存互相干扰。
此外,所有实验和生产流量均基于开源推理框架 SGLang 运行和基准测试,团队认为 SGLang 目前提供了市场上最佳的推理性能。
所属事件:Cloudflare 详解大规模运行 Kimi 与 GLM 显存优化(4 条相关)→
「Infra」频道最新
- GPU 同样的算力四种卖法:Nebius 现货定价背后的基建经济学 — demian_ai · 2026-09-22
- Tata Elxsi 用 AWS 打造 IRIS:边缘过滤削减 70-80% 上云帧量 — AWS ML Blog · 2026-09-22
- bitsandbytes2 略延期:零操作"懒压缩"加动态专家换入,逼近无限 KV cache — Tim_Dettmers · 2026-09-22
- 迭代敏感性探测:Dettmers 解释如何逐层逼近模型压缩崩溃边界 — Tim_Dettmers · 2026-09-22
- Tim Dettmers 发布运行时动态压缩框架,实现 1.5-2.0 bit 高质量压缩 — Tim_Dettmers · 2026-09-22
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22