DeepSeek v4 PRO Q2 实测:VRAM/RAM 混合推理达 45 t/s
antirez · x · 2026-08-17
antirez 展示了在 DGX Station 上运行 DeepSeek v4 PRO Q2 模型的优化成果。通过将路由专家模型拆分至 VRAM 和 RAM,并针对该特定配置优化内核,实现了 45 t/s 的推理速度,并预计未来可以更快。作者称这证明了 DwarfStar 作为工作站推理引擎的潜力。
所属事件:Redis作者优化DeepSeek V4推理速度达45 t/s(3 条相关)→
「Infra」频道最新
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17
- 麦肯锡:自 22 年底美数据中心投资激增 200% — rvp · 2026-08-17
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17
- 250 美元 FPGA 开发板实现 12000 tok/s 推理 — ycombinator · 2026-08-17
- Qwen3.8 实测:MTP 参数影响吞吐,Q4 精度胜过 Q8 — New-Inspection7034 · 2026-08-17
- 12GB 显卡实测:Qwen3.8 27B Q2 可用,MoE 更优 — CoffeeToCode99 · 2026-08-17