Kimi K3 经 DSpark 调优后解码吞吐升至 423 tok/s

ying11231 · x · 2026-07-28

Radixark 表示,他们用 SpecForge 给 Kimi K3 训练了一个 DSpark speculator draft model,把 batch-1 decode 吞吐从约 113 tok/s 提升到 423 tok/s。

结果

引用中的 SGLang 说明还强调,K3 的高速 serving 来自对新架构的原生实现和深度优化,包括 fused KDA decode kernels、DP attention、DSpark、PD disagg 和 KDA-aware prefix caching,并称已通过 Kimi Vendor Verifier,可用于生产。

所属事件:Kimi K3接入SGLang实现423 tok/s高吞吐(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →