开源 PolyServe 自动调优:三款 GPU 吞吐提升 56–97%
AffectionateSir8341 · reddit · 2026-09-17
开发者在 vLLM 社区看到大量「最优配置是什么」的提问后,构建了开源 LLM 自动调优工具 PolyServe:在 vLLM、SGLang、llama.cpp 三种引擎上跑基准,在延迟约束下选出最优配置,并经 OpenAI 兼容 API 提供服务。
实测结果(Llama 3.1 8B,对固定启发式基线):
- RTX 4090:667 → 1,041 tok/s(+56%)
- A100:674 → 1,155 tok/s(+71%)
- A40:257 → 506 tok/s(+97%)
- 基线含 fp8 权重、8-bit KV cache、batch 目标 256;结果在 held-out prompts 上评测,每组三次交叉运行。
对默认配置(Qwen2.5-3B,A40): PolyServe 619 tok/s,超 vLLM 默认 23%、SGLang 默认 30%,p95 首 token 延迟 157 ms(预算 500 ms 内)。
关键权衡: RTX 4090 上跑 Qwen2.5-14B 时放开 4-bit 配置,吞吐从 365 升至 1,412 tok/s,每 token 能耗降 65%,GSM8K 从 190/200 降至 186/200,故 4-bit 默认 opt-in。
用法: pip install polyserve 后 polyserve serve <模型> --workload chat 即可,首次启动需校准(约 22–56 分钟),之后复用缓存结果。MIT 协议,仓库含原始基准数据与质量检查。
「Infra」频道最新
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17
- 深度解析 DeepSeek-V4.1 Flash:把 KV Cache 压缩推到极限 — teortaxesTex · 2026-09-17
- 四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍 — Shrey Pandit · 2026-09-17
- 两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍 — jietang · 2026-09-17