双卡 GH200 跑 DSv4-Flash:优化后吞吐破万
Reddactor · reddit · 2026-08-04
开发者分享了在双卡 GH200 上运行 DeepSeek v4 Flash 模型的极致优化方案。通过 SGLang 框架及特定 PR 补丁,实现了 Prefill(预填充)阶段超 10,000 tokens/s、Token Generation(生成)阶段超 300 tokens/s 的惊人吞吐量。作者还介绍了一个针对超长上下文加速 Pipeline Parallelism(流水线并行)的实用技巧。
「Infra」频道最新
- RTX 5090实测Minimax H3:50分钟生成150万像素图像 — SourceTraining7959 · 2026-08-04
- Kimi K3 投机解码模型下载破 60 万,AMD MI355X 实测吞吐大增 — bookwormengr · 2026-08-04
- RTX 3060 勇闯 MiniMax-H3:5秒视频渲染耗时4分钟 — Robert_Brown_7425 · 2026-08-04
- 单张 AMD MI300X 成功部署 DeepSeek V4 Flash — zhoutong · 2026-08-04
- 安谋科技全面 All in AI:发布自研 NPU 与端云算力新品 — 智东西 · 2026-08-04
- RTX 5090跑图实测:百万像素21:9视频4分钟生成 — AdmirablePainting368 · 2026-08-04