vLLM 深度优化 Kimi K3 推理:吞吐提升 2.2–2.8 倍
vllm_project · x · 2026-09-17
vLLM 官方博客详解 Kimi K3 服务端优化:在 B300 节点、8K/1K 负载、TP8 配置下,相比 v0.27.1 实现吞吐 2.2–2.8 倍提升、延迟降低 56–60%、TTFT 降低 72–85%(并发 1/4/16 三档)。
关键改动覆盖全栈:
- 自适应投机 token 预算(DSpark 投机解码,8 tokens)
- KDA 循环状态的内部 prefix checkpoint 与 zero-copy 混合批次
- MXFP4 专家内核的延迟 finalization
- ReplaySSM、prefill/decode 分离与 cache offload、decode 上下文并行
文章指出调度器限制、小张量拷贝等细节与大型 GEMM 同样影响性能,并给出可直接复现的服务启动命令与 benchmark。相关工作在 issue #50587 跟踪。
「Infra」频道最新
- SemiAnalysis:智能体流量已占全部推理流量超 70% — NinaDSchick · 2026-09-18
- Qwen Flash打破「大内存」迷信:组合式PC架构重新成立 — sn2006gy · 2026-09-18
- 图解四种限流算法:令牌桶、漏桶等的适用场景对比 — _jaydeepkarale · 2026-09-18
- 机器人公司 Watney 融资 8000 万美元,扩建数据中心建造机器人队 — Polymarket · 2026-09-18
- 智谱发文暗怼 Dario:GLM 自建推理基础设施省下大成本 — Elux91 · 2026-09-18
- OpenAI 称 AI 可自动化 80% GDP,swyx 指瓶颈在芯片内存供给 — iamrobotbear · 2026-09-18