单卡 RTX 5090 跑满 DeepSeek 100万上下文,双 CUDA 图让推理提速

BlackBeardAI · reddit · 2026-08-05

开发者分享了在单张 RTX 5090 显卡上运行 DeepSeek-V4-Flash-0731(155GB)并保持原生 100万 token 上下文的最新优化进展。

此前使用固定推测解码深度时,模型在复杂推理阶段和最终代码生成阶段的接受率差异巨大,导致吞吐量不稳定。为此,作者开发了阶段自适应机制:

为解决切换后 CUDA Graph 形状不匹配导致性能暴跌的问题,作者进一步实现了双 CUDA 图捕获,确保两种推测深度都能高效运行。最终在满载 100万上下文时,推理速度提升至约 13.8 tok/s,代码生成达 17.0 tok/s。

所属事件:单卡RTX 5090成功跑满DeepSeek百万上下文(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →