vLLM 推出自适应验证,DSpark 推理性能优化

vllm_project · x · 2026-08-15

vLLM 引入自适应投机采样验证,无需固定 Draft 长度。在 DeepSeek-V4-Pro-0813 模型测试中,首个 Token 存活率超 70%。该特性已合并至主分支,支持从低并发到高并发的全场景 Pareto 最优。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →