开源 PolyServe 自动调优:三款 GPU 吞吐提升 56–97%

AffectionateSir8341 · reddit · 2026-09-17

开发者在 vLLM 社区看到大量「最优配置是什么」的提问后,构建了开源 LLM 自动调优工具 PolyServe:在 vLLM、SGLang、llama.cpp 三种引擎上跑基准,在延迟约束下选出最优配置,并经 OpenAI 兼容 API 提供服务。

实测结果(Llama 3.1 8B,对固定启发式基线):

对默认配置(Qwen2.5-3B,A40): PolyServe 619 tok/s,超 vLLM 默认 23%、SGLang 默认 30%,p95 首 token 延迟 157 ms(预算 500 ms 内)。

关键权衡: RTX 4090 上跑 Qwen2.5-14B 时放开 4-bit 配置,吞吐从 365 升至 1,412 tok/s,每 token 能耗降 65%,GSM8K 从 190/200 降至 186/200,故 4-bit 默认 opt-in。

用法: pip install polyserve 后 polyserve serve <模型> --workload chat 即可,首次启动需校准(约 22–56 分钟),之后复用缓存结果。MIT 协议,仓库含原始基准数据与质量检查。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →