RTX6000 上跑 Qwen 3.8 Flash Next,解码飙到 400 tok/s

lkarlslund · reddit · 2026-10-06

作者分享了其 NInfer 的 fork——NInfer6000,针对 RTX6000 96GB 上的 Qwen 3.8 Flash Next 模型优化推理,理想条件下解码速度达到 400 tok/s、prefill 约 13K tok/s。

关键数据与做法:

该项目因原版 NInfer 只支持 5090 及以下卡、且 VLLM/llama.cpp 对该模型支持不足而诞生。fork 支持 radixark 的 NVFP4 量化和「Swift 1.5」变体(少思考但结果相同),并支持视觉。代码已在 GitHub 开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →