单台 RTX PRO 6000 实测:Qwen3.6 35B NVFP4 推理破 3000 tokens/s
max_paperclips · x · 2026-08-05
开发者在单台 RTX PRO 6000 WorkStation Edition 显卡上,使用 NVFP4 量化格式对 Qwen3.6 35B-A3B 模型进行 16 路并发推理,实现了高达 3,000 tokens/s 的生成速度。
演示中使用了作者自研的工具 ParallelHue,通过颜色编码直观展示了投机解码(speculative decoding)下多个请求同步生成 token 的过程。
「Infra」频道最新
- 删掉90%权重仍能用:MIT宋寒与AI模型量化简史 — JafarNajafov · 2026-08-05
- Cloudflare CEO:AI智能体流量已超人类,未来将达千倍 — 0xSammy · 2026-08-05
- 4x3090跑DeepSeek 284B:优化后预填充飙至1906 tok/s — max_paperclips · 2026-08-05
- RTX 3060 跑 Minimax H3 生成 15 秒需 1.5 小时,开发者求助本地优化 — SMPTHEHEDGEHOG · 2026-08-05
- RTX 5060Ti 16GB 能否跑动 Qwen 27B?玩家探讨本地部署硬件选择 — Yanzihko · 2026-08-05
- AI 盈利助推美股创新高,Palantir 营收大涨 93% — nordicinst · 2026-08-05