8张T4跑Qwen3.5-9B:44槽位实测延迟瓶颈在哪

exaknight21 · reddit · 2026-10-10

作者手头有一台 Asus ESC4000 G3(128GB DDR4),原本想装 V620 但只能装 2 张,改用 8 张 72W 无源散热的 NVIDIA T4。T4 缺乏最新 fp8 emulation 支持,官方已不给资源支持。

当前方案:llama.cpp 跑 8 个独立实例,每个实例服务 Qwen3.5-9B-Q5KXL,共 44 个槽位(每槽约 87k 上下文),供 10-15 人并发使用,跑一个能收邮件、总结文档的非编码 agentic 工作流。单槽生成速度 25-40 tps,prefill 约 1400 tps,延迟表现不佳。

作者想知道是否有比 llama.cpp 更快的方案(如 vLLM 特殊分支或 AWQ-INT8 量化版本),他的 Mi50 32GB 上用 vLLM + AWQ-INT8 就很快。预算已耗尽,未来半年到一年无法投入新资金,求助社区指点瓶颈与优化方向。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →