硬核折腾:16 张 5060Ti 运行 DeepSeek V4
Primary_Exchange21 · reddit · 2026-08-20
一位用户分享了使用 16 张 RTX 5060 Ti 16GB 显卡、通过两个 PLX88096 交换机互联的硬件配置,成功运行 DeepSeek V4 Flash-0731 模型。
- 配置细节:使用 ASRock Rack 主板、Xeon Gold 6330 CPU 和特殊定制的内核参数,成功将每张卡的 BAR1 显存调整为 16GB。
- 性能表现:
- 张量并行 8 + 流水线并行 2:支持 50 万上下文,生成速度约 140 tks。
- 张量并行 4 + 流水线并行 4:支持 100 万上下文,生成速度约 80 tks。
- 成本:整个硬件 setup 的花费仅为 0.6 倍 RTX 6000 Pro 的价格。
「Infra」频道最新
- Rust 编写的高性能无头浏览器 Obscura 发布 — tom_doerr · 2026-08-20
- Unsloth AI 拟推新内核,C8 预测达 300 tok/s — QuixiAI · 2026-08-20
- 通用反编译器来了,只会更便宜更快 — yacineMTB · 2026-08-20
- 单张 RTX 3090 改 48GB 跑 27B Qwen 模型引围观 — MaziyarPanahi · 2026-08-20
- FLUX.1 Dev 存储受限就用 fp8 单文件,CFG 必须设 1.0 — Realistic-Fennel-190 · 2026-08-20
- SK hynix 布局后 HBM 时代:走向 3D 堆叠与解耦 — zephyr_z9 · 2026-08-20