vLLM合入硬件感知动态SD

vllm_project · x · 2026-07-11

vLLM 项目感谢 Cohere 团队把 hardware-aware Dynamic SD 贡献并合并进主干。该方案不再使用固定数量的 draft tokens,而是根据 batch size 和 硬件特性 自适应调整。

核心效果是:

原帖还提到,speculative decoding 在高 batch size 下可能反而变慢,因此很多生产系统难以直接采用;这次的动态方案就是为了解决这个问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →