Inferact 的 Kimi-K3-DSpark 复用 MLA 缓存加速 vLLM
vllm_project · x · 2026-07-27
- Kimi-K3-DSpark 是一个面向 vLLM 的 MLA-native 草稿模型,用来加速 Kimi K3 推理。
- 训练数据来自 vLLM 自身抽取的 target hidden states,也就是直接学习它未来要服务的分布。
- DSpark 由三部分组成:block-diffusion backbone(5 层稠密层,一次并行草拟 7 个 token)、rank=256 的 sequential Markov head,以及一个 confidence head。
- 由于草稿模型复刻了 Kimi K3 的 MLA attention,draft 和 target 可以共享同一套紧凑 KV 布局,从而复用缓存管理和 P/D disaggregated serving 路径。
- 模型卡还说明:在代码等确定性文本上接受率更高,在创意写作等高熵生成上更弱;测评采用了 tensor-parallel-size=8、temperature=1.0、topp=0.95 等接近生产的设置。
所属事件:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(11 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23