Inferact 的 Kimi-K3-DSpark 复用 MLA 缓存加速 vLLM
vllm_project · x · 2026-07-27
- Kimi-K3-DSpark 是一个面向 vLLM 的 MLA-native 草稿模型,用来加速 Kimi K3 推理。
- 训练数据来自 vLLM 自身抽取的 target hidden states,也就是直接学习它未来要服务的分布。
- DSpark 由三部分组成:block-diffusion backbone(5 层稠密层,一次并行草拟 7 个 token)、rank=256 的 sequential Markov head,以及一个 confidence head。
- 由于草稿模型复刻了 Kimi K3 的 MLA attention,draft 和 target 可以共享同一套紧凑 KV 布局,从而复用缓存管理和 P/D disaggregated serving 路径。
- 模型卡还说明:在代码等确定性文本上接受率更高,在创意写作等高熵生成上更弱;测评采用了 tensor-parallel-size=8、temperature=1.0、topp=0.95 等接近生产的设置。
「Infra」频道最新
- Claude 对话被索引后,机密计算方案被再次推上台面 — bittingthembits · 2026-07-27
- Moonshot 开源 MoonEP,开闭源之争再被点燃 — KyeGomezB · 2026-07-27
- Kimi K3 的 2.5 倍 scaling-law 提升引发效率讨论 — andrew_n_carr · 2026-07-27
- Kimi K3 登陆 Nebius:100 万上下文、AA 57 分 — teortaxesTex · 2026-07-27
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27