DeepSeek v4 PRO 实测:DwarfStar 优化显存峰值 50 t/s
antirez · x · 2026-08-18
DeepSeek v4 PRO 在 DwarfStar 上的实测表现:在 DGX Station 上运行,未开启 DSpark 时峰值已达 50 tokens/s。关键技术包括基于历史统计的动态 VRAM/RAM 专家分配、大块数据 4k t/s prefill 以及 layer-major 流式传输。作者指出混合 RAM/VRAM 推理需要谨慎处理。
「Infra」频道最新
- Qwen 27B F16 版本运行实测与显存需求 — Blues520 · 2026-08-18
- M2 Ultra 运行 Qwen3.8-27B 速度基准测试实录 — planetearth80 · 2026-08-18
- GitNexus: 知识图谱让编程 Agent 成本减半 — ycombinator · 2026-08-18
- RDNA4显卡启用SageAttention完整指南:RX 9070 XT实测 — eloxH1Z1 · 2026-08-18
- Qwen3.8-27B 推理优化:RTX 3090 跑出 1150 tps — iamMess · 2026-08-18
- RTX 4090 跑 Qwen 2.5 27B:无溢出配置分享 — gavwhittaker · 2026-08-18