单张 RTX 6000 Pro 跑 Qwen3.8-Next-Flash 飙到 240 t/s
AdventurousSwim1312 · reddit · 2026-08-31
Reddit 用户在 jpezzulli 的 sglang 补丁(178 t/s)基础上,让 AI 迭代数天后把单张 RTX 6000 Pro MaxQ(300W)上 Qwen3.8-Flash-Next-NVFP4 的解码速度推到 近 240 t/s(该模型 nvfp4 理论带宽上限约 280 t/s)。
已用技巧:
- lm head 和若干层从 bf16 进一步量化到 fp8,降低带宽占用
- 部分层 kernel 调优提升 GPU 效率
- MTP 配置调优
接下来计划:全层 nvfp4 量化、层融合 kernel、MTP 后训练并尝试 eagle3 head。复现资源齐全:补丁仓库、起始仓库与模型 checkpoint 均已开源。测试配置:Ryzen 9 3950X + 128GB RAM(放 ngram 表)+ 1x RTX 6000 Pro MaxQ。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01