Kimi K3 经 DSpark 调优后解码吞吐升至 423 tok/s
ying11231 · x · 2026-07-28
Radixark 表示,他们用 SpecForge 给 Kimi K3 训练了一个 DSpark speculator draft model,把 batch-1 decode 吞吐从约 113 tok/s 提升到 423 tok/s。
结果
- 在 bs=256 的 chat 场景里,相比 verify-all,吞吐提升 68%,且是 lossless
- 在 GSM8K 上 accept length 为 5.67,在 HumanEval 上为 5.36
引用中的 SGLang 说明还强调,K3 的高速 serving 来自对新架构的原生实现和深度优化,包括 fused KDA decode kernels、DP attention、DSpark、PD disagg 和 KDA-aware prefix caching,并称已通过 Kimi Vendor Verifier,可用于生产。
所属事件:Kimi K3接入SGLang实现423 tok/s高吞吐(4 条相关)→
「Infra」频道最新
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计 — stochasticchasm · 2026-07-28
- SkyPilot 称,部署 Kimi K3 需要多节点推理和完整服务栈 — skypilot_org · 2026-07-28
- 6600XT 用户称 ROCm 在 LM Studio 里比 Vulkan 更慢 — InsideYork · 2026-07-28
- Moonshot 的 Mooncake 服务架构让长上下文吞吐最高提升 525% — stochasticchasm · 2026-07-28