Cloudflare 详解大规模运行 Kimi 与 GLM 的推理优化

michellechen · x · 2026-08-03

Cloudflare 发布技术博客,分享了在其 Workers AI 上大规模运行 Kimi 和 GLM 等万亿参数模型的底层优化经验。

为了解决这些大型长上下文 MoE 模型的内存受限问题,团队主要采用了三项技术:

此外,所有实验和生产流量均基于开源推理框架 SGLang 运行和基准测试,团队认为 SGLang 目前提供了市场上最佳的推理性能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →