单卡 RTX 5090 跑满 DeepSeek 100万上下文,双 CUDA 图让推理提速
BlackBeardAI · reddit · 2026-08-05
开发者分享了在单张 RTX 5090 显卡上运行 DeepSeek-V4-Flash-0731(155GB)并保持原生 100万 token 上下文的最新优化进展。
此前使用固定推测解码深度时,模型在复杂推理阶段和最终代码生成阶段的接受率差异巨大,导致吞吐量不稳定。为此,作者开发了阶段自适应机制:
- 检测到模型处于 <think> 推理阶段时,自动切换至 K=1;
- 检测到输出常规内容或代码时,切换回 K=2。
为解决切换后 CUDA Graph 形状不匹配导致性能暴跌的问题,作者进一步实现了双 CUDA 图捕获,确保两种推测深度都能高效运行。最终在满载 100万上下文时,推理速度提升至约 13.8 tok/s,代码生成达 17.0 tok/s。
所属事件:单卡RTX 5090成功跑满DeepSeek百万上下文(2 条相关)→
「Infra」频道最新
- 推理非投机:Token 消费不同于泡沫期硬件囤积 — AccBalanced · 2026-08-26
- 高通 Oryon CPU 跑 5GHz,FlexCache 助力 Agent — davemccollough · 2026-08-26
- 买本地跑模型的机器前,先问 AI 你的具体需求 — cocktailpeanut · 2026-08-26
- 配置变更导致 17% 进程崩溃,重试浪涌引发连锁事故 — techNmak · 2026-08-26
- 遥测服务致 K8s 控制平面过载,OpenAI 全线宕机复盘 — techNmak · 2026-08-26
- 17%会话进程瞬间掉线引发级联故障,Discord宕机复盘 — techNmak · 2026-08-26