RTX 3090 跑 DeepSeek-V4-Flash:128GB 内存 + 特殊参数实现 12.5 tok/s
Ok_Ninja7526 · reddit · 2026-08-02
Reddit 用户 OkNinja7526 分享了在 RTX 3090 24GB + 128GB DDR5(超频至 5600MHz)上运行 DeepSeek-V4-Flash-0731 UD-IQ3S 的经验。通过替换 text-generation-webui 中的 llama.cpp 二进制文件,并设置关键参数 --n-cpu-moe 39(将部分 MoE 专家保留在系统内存),成功运行模型,速度约 12.5 tok/s。模型加载约需 136GB 内存,主要依赖 CPU 和内存带宽。
「Infra」频道最新
- 英伟达Rubin GPU预计2026年底降90%推理成本 — haider1 · 2026-08-02
- 小团队选 GPU 云算力:除了价格还要看什么? — 9ds996Dev · 2026-08-02
- Rust 编译器性能演进:rustdoc 构建耗时大幅缩减 28% — charliermarsh · 2026-08-02
- 算力仍是硬道理:法国AI圈反思与DeepSeek的效率差距 — AymericRoucher · 2026-08-02
- 分析称 OpenAI 承载科技股大盘,Azure 增长极度依赖其算力投入 — ylecun · 2026-08-02
- DeepSeek-V4-Flash 在 RTX PRO 6000 eGPU 上跑出 44-59.5 tok/s 解码速度 — backslashHH · 2026-08-02