单台 RTX PRO 6000 实测:Qwen3.6 35B NVFP4 推理破 3000 tokens/s

max_paperclips · x · 2026-08-05

开发者在单台 RTX PRO 6000 WorkStation Edition 显卡上,使用 NVFP4 量化格式对 Qwen3.6 35B-A3B 模型进行 16 路并发推理,实现了高达 3,000 tokens/s 的生成速度。

演示中使用了作者自研的工具 ParallelHue,通过颜色编码直观展示了投机解码(speculative decoding)下多个请求同步生成 token 的过程。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →