Kimi K3 接入 SGLang,首日跑到 423 tok/s
ying11231 · x · 2026-07-28
- Kimi K3 已在 SGLang 上线,作者称其在 GSM8K 上达到 423 tok/s 的 day-0 速度。
- 帖子强调:演示视频本身就是由 Kimi K3 生成,而且运行在同一套正在发布的服务栈上,形成了“模型演示模型基础设施”的递归效果。
- 工程侧信息包括:2.8T MoE、新的 KDA 架构,以及为此做的深度 serving 优化——fused decode kernels、DP attention、DSpark、PD disagg 和 KDA-aware prefix caching。
- 另外,发布首日就有 11 家云伙伴 支持部署,被包装成开源生态里“模型、基础设施、云厂商同步交付”的案例。
所属事件:SGLang首发支持Kimi K3,吞吐量飙升至423 tok/s(8 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11