vLLM 投机解码上线 AMD MI300X/MI355X,多 token 并行验证降延迟

petrusenko_max · x · 2026-09-07

vLLM 在 AMD MI300X 和 MI355X GPU 上支持投机解码(speculative decoding):一次验证多个候选 token,替代逐 token 的标准解码,从而降低延迟,同时保持输出行为不变。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →