三周优化,vLLM 上 DeepSeek-V4.1-Flash 吞吐提升 5.3 倍
vllm_project · x · 2026-10-08
vLLM 团队发布博客,详解 DeepSeek-V4.1-Flash 发布后三周内的性能优化:低并发下提速 1.9 倍,在 SemiAnalysis AgentX 基准 150 TPS/用户约束下吞吐提升 5.3 倍。
- 模型侧:CED 架构 prefill 激活 8B、decode 激活 16B;CSA2、FP4 KV cache、层间 KV 共享将全局 KV 压到 890 字节/token
- SWA bounded replay:前缀命中后只重放最后 128 个 token 的滑动窗口 KV,配合 CUDA graphs 使 prefill 计算降 30-40%,TTFT 降约 30%
- 集成 DeepSeek 新内核:MegaAttention(NVFP4 KV,小 45%)、Mega-mHC、Mega-Gate、DeepSelect,以及 CuTe-DSL 融合 WO-A(ITL 降 6-7%)、mHC 侧流、稀疏 MQA logits(512K 下每层快 14-23 倍)
「Infra」频道最新
- CoreWeave Fully Connected 大批产品齐发,SVP 首先向自家团队道歉 — thursdai_pod · 2026-10-08
- DuckDB 官方演示「零数据」数据库:几百 KB 管理整个数据湖 — RexDouglass · 2026-10-08
- Yudkowsky:预训练算力份额已降至 7%,能力尖峰预测重新生效 — repligate · 2026-10-08
- National Compute 上线数百台 MI355x 与 B300,免费补贴高校与政府 — ycombinator · 2026-10-08
- 微软 Windows 发布会秀本地模型,GitHub 推出 Auto 模型路由 — DanWahlin · 2026-10-08
- xAI 算法:Elon 以实验室估值募资投芯片,靠租数据中心赚钱 — PaulYacoubian · 2026-10-08