RTX 6000 Pro 跑 Qwen3.8 性能实测:96GB 显存达 109 tok/s
FantasticNature7590 · reddit · 2026-09-01
用户在 RTX 6000 Pro (96GB VRAM) 上对 Qwen3.8-Flash-Next-GGUF 模型进行了详尽的 llama.cpp 部署与性能测试,量化方案为 UD-IQ4XS。
核心发现
- 吞吐量差异巨大:CPU 解码仅 8.34 tok/s;利用全部 96GB 显存时达 109.07 tok/s。
- 长上下文收敛:在 2K 提示词下,96GB 比 24GB 快 2.8 倍;但在 245K 超长上下文下,优势缩减至 1.45 倍(24GB 为 14.89 tok/s,96GB 为 21.61 tok/s)。
- PLE 表位置陷阱:将 27.2GB 的 PLE (Per-Layer Embedding) 表强放入 CUDA 显存导致解码速度暴跌 55.6 倍(从 108.5 降至 1.95 tok/s),置于内存反而最快。
实测数据表 (2K Prompt)
| 显存 | 预填充 | 解码 |
| :--- | :--- | :--- |
| CPU Only | 182.64 | 8.34 |
| 24GB | 260 | 39.01 |
| 48GB | 746.7 | 51.73 |
| 96GB | 1,955 | 109.07 |
测试指出,显存瓶颈主要限制模型加载层�数,而 Gated DeltaNet 架构虽节省了部分显存,并未使长上下文解码免费。
所属事件:单卡96GB实测Qwen3.8 跑通17万上下文(2 条相关)→
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01