DeepSeek V4 Flash 3bit 量化版 3x3090 实测:119GB 占用
consultkitapp · reddit · 2026-08-02
发帖者分享了 DeepSeek-V4-Flash-0731-UD-Q3KXL 量化模型在 3 张 RTX 3090 显卡(总显存 72GB)上的 llama-bench 基准测试结果。
测试数据:
- 模型体积:119.40 GiB(约 284.33B 参数)。
- 提示词处理 (pp512):速度约为 116.04 t/s。
- 文本生成 (tg128):速度约为 7.71 t/s。
测试时使用了 21 层 GPU 卸载 (-ngl 21) 和层拆分模式 (--split-mode layer)。发帖者认为该量化版本的性能还有进一步压榨的空间。
「Infra」频道最新
- DeepSeek 新发布大幅提升 Nvidia DGX Spark 本地部署价值 — firstadopter · 2026-08-02
- 开发者展示在 Dell 独立迷你主机上本地运行 Hermes 模型 — burhop · 2026-08-02
- State of AI 算力指数更新:Anthropic 与 OpenAI 大幅采用非英伟达芯片 — nathanbenaich · 2026-08-02
- 马里兰州一县通过法案:暂停数据中心建设 18 个月 — LadyGagas913 · 2026-08-02
- 算力之后的新瓶颈:电力短缺正成为 AI 竞赛的决定因素 — ingliguori · 2026-08-02
- AMD MI355X 推理性能跑赢 B200,社区优化立功 — marksaroufim · 2026-08-02