SGLang 称 Kimi K3 上线即达 423 tok/s,推理栈深度优化
ying11231 · x · 2026-07-29
- SGLang 表示,Kimi K3 在 day 0 就能跑到 423 tok/s(GSM8K 测得),而且 RL 支持已经在 Miles 里就绪。
- 他们称这是对 K3 新架构的原生实现和深度优化,用了 fused KDA decode kernels、DP attention、DSpark、PD disagg 和 KDA-aware prefix caching。
- 团队还表示已经通过 Kimi Vendor Verifier,并且这套方案已可用于生产环境。
- 帖子列出了 Moonshot、NVIDIA、AMD、KVCache AI、Modal、Baseten 以及多家云/推理平台的协作。
- 评论区还会给出 blog、cookbook 和 benchmark;演示视频据称也是由 Kimi K3 自己生成的。
所属事件:SGLang首发支持Kimi K3,推测解码飙至423 tok/s(8 条相关)→
「Infra」频道最新
- YC 初创 hwintelligence 推出带验证 agent 的波形调试器 — ycombinator · 2026-07-29
- Broadcom 说 AI 可能把漏洞利用窗口从几周压到几小时 — therealdanvega · 2026-07-29
- camelAI 把 agent 从虚拟机迁到 Cloudflare Durable Object — irvinebroque · 2026-07-29
- LLM 推理手册汇总生产部署、选卡与优化指南 — carrycooldude · 2026-07-29
- MLCommons 发布 MLPerf Endpoints v0.7 推理基准 — TheKanter · 2026-07-29
- 个人项目可对比云厂商并自动生成 Terraform — Character-Ring5785 · 2026-07-29