vLLM 集成 DeepSeek 内核,10 万级吞吐下 TTFT 降近 70%
vllm_project · x · 2026-10-08
vLLM 项目宣布一系列推理栈优化,在约 10 万吞吐下首 token 延迟(TTFT)下降近 70%。
- 内核层面:集成 DeepSeek 的 MegaAttention(NVFP4 KV 缓存,体积缩小 45%)、Mega-mHC、Mega-Gate 与 DeepSelect。
- vLLM 侧融合:基于 CuTe-DSL 的融合 WO-A 算子(ITL 最高降低约 6–7%)、侧流上的 mHC 系数计算、稀疏 MQA logits(512K 上下文下每层快 14–23 倍)。
由 @inferact 与 vLLM 社区构建,DeepSeek 提供模型与内核,NVIDIA 参与协作,SemiAnalysis 提供 AgentX 支持。
「Infra」频道最新
- xAI 算法:Elon 以实验室估值募资投芯片,靠租数据中心赚钱 — PaulYacoubian · 2026-10-08
- 标普 3/4 盈利增长靠科技,AI 行情进入选股分化期 — demian_ai · 2026-10-08
- OpenAI 12 万文件数学证明撑爆 Linux 默认 mmap 上限 — ceciletamura · 2026-10-08
- Mistral 研究员:15T tokens 低估了,预训练实际约 40T+ — eliebakouch · 2026-10-08
- DevDay 2026:Higgsfield 展示 Agent 自行申请算力的架构实践 — OpenAI · 2026-10-08
- Nebius 年涨160%对CoreWeave仅10%,AI算力股分化拆解 — Beth_Kindig · 2026-10-08