RTX6000 上跑 Qwen 3.8 Flash Next,解码飙到 400 tok/s
lkarlslund · reddit · 2026-10-06
作者分享了其 NInfer 的 fork——NInfer6000,针对 RTX6000 96GB 上的 Qwen 3.8 Flash Next 模型优化推理,理想条件下解码速度达到 400 tok/s、prefill 约 13K tok/s。
关键数据与做法:
- 无投机解码:512 上下文下 16-bit 118 tok/s,8-bit 172 tok/s(+46%)
- MTP3 投机解码:512 上下文 8-bit 达 256 tok/s;8K 上下文 381.5 tok/s(+42%)
- MTP3 加 --lm-head-draft 小草稿头:8K 上下文 401.3 tok/s
- Prefill:512 tokens 时 8-bit 反而慢 12%,8K 长度无差异(约 13.9K tok/s)
该项目因原版 NInfer 只支持 5090 及以下卡、且 VLLM/llama.cpp 对该模型支持不足而诞生。fork 支持 radixark 的 NVFP4 量化和「Swift 1.5」变体(少思考但结果相同),并支持视觉。代码已在 GitHub 开源。
「Infra」频道最新
- AMD 苏姿丰:未来几年芯片需求将持续「非常高」 — AryHHAry · 2026-10-06
- 光子 AI 芯片可自校准:利用误差信号原位梯度下降,MSE 降至 0.0013 — bravo_abad · 2026-10-06
- Qwen3.8-Flash-Next 4-bit 本地机配置单:96GB 内存+二手 3090 混合推理 — Confident-Truth3607 · 2026-10-06
- 单台 DGX Spark 跑 510GB 的 DeepSeek V4.1 Flash:113.6GB 量化底座+40MB 领域侧挂件 — Physical_Toe_2499 · 2026-10-06
- 美国防部 AI 老兵:数据才是军事 AI 的真正瓶颈 — ChinaTalk · 2026-10-06
- Hugging Face Kernels 教程:一行代码加载 GPU 优化计算核 — ariG23498 · 2026-10-06