RTX 5090+4070 TiS 双卡跑 Qwen 27B FP8,258K 上下文实测
Fz1zz · reddit · 2026-09-27
Reddit 用户用 RTX 5090(32GB)+ RTX 4070 Ti Super(16GB)共 48GB 显存,在 vLLM 0.30.0 上以流水线并行方式跑通了 Qwen3.8-27B 的 block-FP8 量化版(28.75 GiB):4070 承载第 0-19 层和视觉编码器,5090 承载第 20-63 层、lmhead 和 MTP。
实测数据:
- 1K 输入/512 输出、单并发:81.3 tok/s(ITL 36.7ms),代码场景约 100 tok/s
- MTP 接受率约 87%,完整 262,144 上下文,fp8 KV
- 32K prefill 3,160 tok/s;145K fresh prefill 约 68.6s;258K prefill 169s,5090 峰值显存 31,472 MiB
作者还提到 4070 Ti Super 因担心 PCIe x1 带宽拖慢而闲置了两个月,实测证明影响不大——对想用混合显卡跑大模型的人有参考价值。
「Infra」频道最新
- 托管推理三大迷思:单价不是账单、端点不可互换、自建未必省 — TangeloOk9486 · 2026-09-27
- Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选 — jiqizhixin · 2026-09-27
- 4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B — ImBadGuyInEveryStory · 2026-09-27
- 自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路 — A_K_Nain · 2026-09-27
- TensorSharp 开源框架支持单请求混合文档/图像/视频/音频证据 — fuzhongkai · 2026-09-27
- 智库学者反数据中心抗议者现场交锋,为算力建设辩护 — neil_chilson · 2026-09-27