DeepSeek-V4-Flash 在 RTX PRO 6000 eGPU 上跑出 44-59.5 tok/s 解码速度
backslashHH · reddit · 2026-08-02
Reddit 用户 backslashHH 分享了在 Bosgame M5 迷你主机搭配 RTX PRO 6000 Max-Q eGPU 上运行 DeepSeek-V4-Flash-0731 的实测数据。使用 llama.cpp 和 DSpark 草稿模型,不同量化下的解码速度:UD-Q8KXL 为 44.0 t/s,UD-Q4KXL 为 48.4 t/s,UD-Q2KXL 为 59.5 t/s(无草稿模型)。Prefill 速度分别为 564、585、1513 t/s。帖子还提供了详细的启动命令和层分配配置。
「Infra」频道最新
- 英伟达Rubin GPU预计2026年底降90%推理成本 — haider1 · 2026-08-02
- 小团队选 GPU 云算力:除了价格还要看什么? — 9ds996Dev · 2026-08-02
- Rust 编译器性能演进:rustdoc 构建耗时大幅缩减 28% — charliermarsh · 2026-08-02
- 算力仍是硬道理:法国AI圈反思与DeepSeek的效率差距 — AymericRoucher · 2026-08-02
- 分析称 OpenAI 承载科技股大盘,Azure 增长极度依赖其算力投入 — ylecun · 2026-08-02
- RTX 3090 跑 DeepSeek-V4-Flash:128GB 内存 + 特殊参数实现 12.5 tok/s — Ok_Ninja7526 · 2026-08-02