双卡 RTX 6000 Pro 即可本地跑满 DeepSeek 1M 上下文
dee_hw · x · 2026-08-03
开发者分享了最新的本地 AI 工作站组装方案:选用两张 RTX PRO 6000 显卡。得益于 DeepSeek V4-Flash 采用的滑动窗口注意力机制,KV 缓存仅需保留局部窗口,因此该双卡配置(192GB 显存)足以在桌面端静音运行完整的 100 万上下文窗口,而无需升级为笨重嘈杂的 4 卡或 8 卡服务器。
所属事件:DeepSeek-V4-Flash 多硬件实测:从消费级到 DGX Spark 全覆盖(26 条相关)→
「Infra」频道最新
- 单节点 B300 跑 2.8T 模型,K3 解码吞吐量达 947 tokens/s — casper_hansen_ · 2026-08-03
- Teknium:DeepSeek V4 Flash本地推理可达70 tokens/s — Teknium · 2026-08-03
- AI圈热议:开源模型已足够好,真正的壁垒是OpenAI的吉瓦级算力 — yacineMTB · 2026-08-03
- Fluidstack 大规模招聘数据中心工程人才,发力 GW 级 AI 算力设施 — MxMnr · 2026-08-03
- 纯本地离线运行:ESP32S3 微控制器跑起专属问答模型 — slvDev_ · 2026-08-03
- NVIDIA 与 Ilya Sutskever 的 SSI 合作,扩大 Vera Rubin 算力访问 — thione · 2026-08-03