vLLM×TileRT 集成详解:prefill/decode 分离,延迟敏感场景可插拔换解码引擎

vllm_project · x · 2026-09-25

vLLM 博客详解与 TileRT 的集成:分离式服务把计算密集的 prefill 与受内存带宽限制的 decode 解耦已成规模化服务标准,而分离后的 decode 侧变成可插拔选项。vLLM 原生 decode 仍是高吞吐批量服务的默认;但 agentic 循环、交互式编码助手、实时语音等延迟敏感场景,需要单用户解码速度最大化的引擎——TileRT 正为此设计。通过 vLLM V1 公开连接器接口接入,随 TileRT 0.1.5 发布,部署其余部分保持原生 vLLM。基准配置已公开在 InferenceX 仓库。

所属事件:vLLM 集成 TileRT,AMD 8×MI355X 跑 GLM-5.3 比 GB300 快 40%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →