DeepSeek V4 Flash 3bit 量化版 3x3090 实测:119GB 占用

consultkitapp · reddit · 2026-08-02

发帖者分享了 DeepSeek-V4-Flash-0731-UD-Q3KXL 量化模型在 3 张 RTX 3090 显卡(总显存 72GB)上的 llama-bench 基准测试结果。

测试数据:

测试时使用了 21 层 GPU 卸载 (-ngl 21) 和层拆分模式 (--split-mode layer)。发帖者认为该量化版本的性能还有进一步压榨的空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →