单张 RTX 6000 Pro 跑 Qwen3.8-Next-Flash 飙到 240 t/s

AdventurousSwim1312 · reddit · 2026-08-31

Reddit 用户在 jpezzulli 的 sglang 补丁(178 t/s)基础上,让 AI 迭代数天后把单张 RTX 6000 Pro MaxQ(300W)上 Qwen3.8-Flash-Next-NVFP4 的解码速度推到 近 240 t/s(该模型 nvfp4 理论带宽上限约 280 t/s)。

已用技巧:

接下来计划:全层 nvfp4 量化、层融合 kernel、MTP 后训练并尝试 eagle3 head。复现资源齐全:补丁仓库、起始仓库与模型 checkpoint 均已开源。测试配置:Ryzen 9 3950X + 128GB RAM(放 ngram 表)+ 1x RTX 6000 Pro MaxQ。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →