双卡 GH200 跑 DSv4-Flash:优化后吞吐破万

Reddactor · reddit · 2026-08-04

开发者分享了在双卡 GH200 上运行 DeepSeek v4 Flash 模型的极致优化方案。通过 SGLang 框架及特定 PR 补丁,实现了 Prefill(预填充)阶段超 10,000 tokens/s、Token Generation(生成)阶段超 300 tokens/s 的惊人吞吐量。作者还介绍了一个针对超长上下文加速 Pipeline Parallelism(流水线并行)的实用技巧。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →