vLLM 集成 DeepSeek 内核,10 万级吞吐下 TTFT 降近 70%

vllm_project · x · 2026-10-08

vLLM 项目宣布一系列推理栈优化,在约 10 万吞吐下首 token 延迟(TTFT)下降近 70%。

由 @inferact 与 vLLM 社区构建,DeepSeek 提供模型与内核,NVIDIA 参与协作,SemiAnalysis 提供 AgentX 支持。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →