DGX Station 外接一张 RTX Pro 6K:DeepSeek V4.1 Flash 预填冲上 6 万 tok/s
Sentdex · x · 2026-10-07
Sentdex 分享了 NVIDIA DGX Station GB300 的进阶玩法:再加一张 RTX Pro 6000 Blackwell Max-Q 作为 MoE「专家侧车」——模型专家放不进 GB300 的 HBM 时,由 RTX Pro 6000 的 96GB 显存承载冷专家并在卡上计算。实测跑 DeepSeek V4.1 Flash 时,加侧卡后 prefill 达到约 60,000 tok/s,首字延迟(TTFT)体验极佳。他引用的 GitHub 仓库 original-el8/dgx-station-gb300-research 记录了 2026 年 9 月 23–25 日三天的完整实测,包含 MegaMoE 热专家放 GB300、3960 个冷专家放 RTX Pro 6000 的配置(复现 Al-ENGR v20 recipe,吞吐 583/821 tok/s 等),覆盖 DeepSeek、MiMo、Qwen 系列多个 MoE 模型,每个数字都链接到原始结果文件,未通过质量门限的配置也有标注。
所属事件:DGX Station 加装 RTX Pro 6K 实现 DeepSeek 高速推理(2 条相关)→
「Infra」频道最新
- Macrocosmos 推 iota SDK:同一套算力可租用于预训练、RL 与推理 — markjeffrey · 2026-10-07
- AI 算力云 Lambda 拟融资 40 亿美元,投前估值 145 亿冲刺 IPO — gharik · 2026-10-07
- AgentID 上线:给 AI Agent 一键颁发独立身份登录应用 — testingcatalog · 2026-10-07
- 报告:智能体数据过路费——企业 agent 数据服务支出 2030 年将达 300 亿美元 — BenBajarin · 2026-10-07
- 华为测试 256K 卡 Atlas-950 超节点,目标百万卡如一机 — teortaxesTex · 2026-10-07
- MIT CSAIL 推出 Ascent Lab:浏览器里设计机器人并训练行走 — MIT_CSAIL · 2026-10-07