DGX Station 外接一张 RTX Pro 6K:DeepSeek V4.1 Flash 预填冲上 6 万 tok/s

Sentdex · x · 2026-10-07

Sentdex 分享了 NVIDIA DGX Station GB300 的进阶玩法:再加一张 RTX Pro 6000 Blackwell Max-Q 作为 MoE「专家侧车」——模型专家放不进 GB300 的 HBM 时,由 RTX Pro 6000 的 96GB 显存承载冷专家并在卡上计算。实测跑 DeepSeek V4.1 Flash 时,加侧卡后 prefill 达到约 60,000 tok/s,首字延迟(TTFT)体验极佳。他引用的 GitHub 仓库 original-el8/dgx-station-gb300-research 记录了 2026 年 9 月 23–25 日三天的完整实测,包含 MegaMoE 热专家放 GB300、3960 个冷专家放 RTX Pro 6000 的配置(复现 Al-ENGR v20 recipe,吞吐 583/821 tok/s 等),覆盖 DeepSeek、MiMo、Qwen 系列多个 MoE 模型,每个数字都链接到原始结果文件,未通过质量门限的配置也有标注。

所属事件:DGX Station 加装 RTX Pro 6K 实现 DeepSeek 高速推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →