8张T4跑Qwen3.5-9B:44槽位实测延迟瓶颈在哪
exaknight21 · reddit · 2026-10-10
作者手头有一台 Asus ESC4000 G3(128GB DDR4),原本想装 V620 但只能装 2 张,改用 8 张 72W 无源散热的 NVIDIA T4。T4 缺乏最新 fp8 emulation 支持,官方已不给资源支持。
当前方案:llama.cpp 跑 8 个独立实例,每个实例服务 Qwen3.5-9B-Q5KXL,共 44 个槽位(每槽约 87k 上下文),供 10-15 人并发使用,跑一个能收邮件、总结文档的非编码 agentic 工作流。单槽生成速度 25-40 tps,prefill 约 1400 tps,延迟表现不佳。
作者想知道是否有比 llama.cpp 更快的方案(如 vLLM 特殊分支或 AWQ-INT8 量化版本),他的 Mi50 32GB 上用 vLLM + AWQ-INT8 就很快。预算已耗尽,未来半年到一年无法投入新资金,求助社区指点瓶颈与优化方向。
「Infra」频道最新
- AI 热潮变债务热潮:Oracle 5年CDS 近纪录261bp,隐含违约率20.4% — cyb3rops · 2026-10-10
- Fireworks AI 遭内部凭证被盗用,已撤销并称未见客户数据受影响 — lqiao · 2026-10-10
- 美国电网今年新增 86GW,AI 实验室需求达数百 GW — FinanceYF5 · 2026-10-10
- Qwen3.6 35B-A3B 跑进 6GB 显存:131K 上下文 + 视觉,附完整 llama.cpp 配置 — Szadbaverem69 · 2026-10-10
- SpaceX 星舰工厂瞄准年产 1000 艘,佛州 Gigabay 体量超现厂房 11 倍 — XFreeze · 2026-10-10
- 读懂 CUDA Programming Model 一章,GPU 执行与内存管理就懂了大半 — blelbach · 2026-10-10