双卡 RTX 6000 实测 DeepSeek:投机解码跑出 243 tok/s
TheZachMueller · x · 2026-08-02
开发者在 2× RTX PRO 6000 Blackwell 上实测了 DeepSeek-V4-Flash-0731 模型结合 DSpark 投机解码的推理性能。
- 核心成绩:单流吞吐量中位数达 243 tok/s,是不使用投机解码基线的 3.1 倍;聚合吞吐量在 c2 和 c4 并发下分别达 299 和 403 tok/s。
- 稳定性:草稿接受率为 74-76%,在 3 小时的混合负载压力测试中稳定保持在 237-245 tok/s。
- 瓶颈分析:未遇到预期的 SM120 kernel 瓶颈,但发现当 maxnumseqs > 4 时会因 prefill chunk 大小硬编码导致空切片输入而报错。将其限制为 4 后系统运行完美,作者已将其作为日常主力环境。
所属事件:双卡RTX 6000本地实测DeepSeek V4(2 条相关)→
「Infra」频道最新
- 算力之后的新瓶颈:电力短缺正成为 AI 竞赛的决定因素 — ingliguori · 2026-08-02
- AMD MI355X 推理性能跑赢 B200,社区优化立功 — marksaroufim · 2026-08-02
- Together AI 月处理 Token 量超 400 万亿,实现万倍增长 — togethercompute · 2026-08-02
- DeepSeek V4 Flash 3bit 量化版 3x3090 实测:119GB 占用 — consultkitapp · 2026-08-02
- 12GB 显存已够用?本地跑大模型的显卡升级抉择 — rettdit · 2026-08-02
- 多卡满载部署 DeepSeek V4,Prompt 处理速度仅 600 t/s — fragment_me · 2026-08-02