Qwen3.8-27B 在 4x RTX 3090 上的深度基准测试
Mr_Moonsilver · reddit · 2026-08-18
基于 4x RTX 3090 (24GB) NVLink 拓扑的深度测试,揭示了 Qwen3.8-27B 在消费级显卡集群上的关键性能特征:
- 拓扑优于核心数:在高并发下,双卡 TP=2 (利用 NVLink) 的吞吐量比四卡 TP=4 (跨 PCIe 通信) 高出 33–41%。跨 PCIe 的 All-reduce 开销随 Batch 增大成为瓶颈。建议运行 2 个 TP=2 实例以榨干硬件。
- MTP 推测解码反而变慢:尽管 MTP 接受率达 64%,但在 Ampere 架构 + AWQ 量化下,推测步耗时是基础步的 3.5 倍,导致整体收益为负。在 3090/A 系列卡上应关闭该功能。
- Prompt Processing 串行化:Prefill 阶段并未并行处理,增加并发数不会提升吞吐量,只会导致请求排队。
- 长文与显存:TP=4 配置下 KV 池达 145 万 Token,可支持 5 个并发的 262k 长上下文请求,性能极为强劲。
「Infra」频道最新
- Qwen 3.8 27b 跑单 GPU,预示数据中心将消亡? — francoisfleuret · 2026-08-18
- YC 项目 Codag 发布:Agent 上下文压缩 3 倍,监控工具调用成本 — ycombinator · 2026-08-18
- Kubeflow 正式从 CNCF 毕业,成云原生 AI 运维标准 — unixterminal · 2026-08-18
- DuckDB 2.0 测试反馈:Async I/O 助其成为最快数据湖引擎 — josh_wills · 2026-08-18
- Agent 记忆架构心得:对话量增大后向量库比文本笔记更优 — rseroter · 2026-08-18
- AI 发展遇阻:电网并网排队时间激增至 45 个月 — PeterDiamandis · 2026-08-18