DeepSeek-V4-Flash 实测:4张 RTX PRO 6000 跑出 2100 tok/s
BanghuaZ · x · 2026-08-01
分享了疑似 DeepSeek-V4-Flash-0731 模型在 4 张 RTX PRO 6000 (SM120) 上的实测推理数据。
- 硬件与框架:基于 SGLang 框架与 DSpark 部署。
- 吞吐表现:单流约 200-225 tok/s;在 32 并发下聚合吞吐量约 2100 tok/s。
- 精度与修复:GSM8K 准确率达到 0.99。由于架构较新,需应用 3 行 FlashInfer 补丁(设置 topk=192)才能正常运行。
作者强调所有数据均经过实际测量且可复现。
「Infra」频道最新
- AI 智能体大爆发会压垮互联网基础设施吗? — Ok-Video4323 · 2026-08-01
- Kimi K3 推理速度破纪录:达 172 tokens/秒 — AccBalanced · 2026-08-01
- 马斯克宣布SpaceX招募精英,打造地表与太空最强AI超算集群 — elonmusk · 2026-08-01
- audio.cpp 0.5 发布:支持戏剧化 TTS 与跨语种语音转换 — Acceptable-Cycle4645 · 2026-08-01
- 马斯克预警 AI 新危机:年底芯片产能将远超电力供应 — r0ck3t23 · 2026-08-01
- Gary Marcus警示:英伟达重蹈电信泡沫覆辙? — GaryMarcus · 2026-08-01