RTX 3090 跑 DeepSeek-V4-Flash:128GB 内存 + 特殊参数实现 12.5 tok/s

Ok_Ninja7526 · reddit · 2026-08-02

Reddit 用户 OkNinja7526 分享了在 RTX 3090 24GB + 128GB DDR5(超频至 5600MHz)上运行 DeepSeek-V4-Flash-0731 UD-IQ3S 的经验。通过替换 text-generation-webui 中的 llama.cpp 二进制文件,并设置关键参数 --n-cpu-moe 39(将部分 MoE 专家保留在系统内存),成功运行模型,速度约 12.5 tok/s。模型加载约需 136GB 内存,主要依赖 CPU 和内存带宽。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →