vLLM 完整支持 DeepSeek-V4.1-Flash 新架构,含投机解码与 PD 分离
vllm_project · x · 2026-09-10
vLLM 项目宣布完整支持 DeepSeek-V4.1-Flash 的新架构,要点包括:
- 多种并行方式:TP/SP/DP/EP
- DSpark 自适应验证的投机解码
- 面向 Agent 场景:前缀缓存、KV cache offloading、PD 分离(prefill/decode disaggregation)
- Engram CPU offloading 与 DP-aware sharding
- 计算与 KV cache 高效的 SWA bounded replay
来自 DeepGeMM 与 FlashMLA 的更多 kernel 集成也即将落地。
「Infra」频道最新
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10
- 截图显示 V4 时代 KV cache 机制存在 72 小时限制 — zephyr_z9 · 2026-09-10
- DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍 — zephyr_z9 · 2026-09-10
- 评论者称其推理架构复杂到基础设施商难以复制,建议自建可抽成 10-20% — zephyr_z9 · 2026-09-10