DeepSeek-V4-Flash 量化版 A100 实测:仅占 15.8GB 显存

Different-Pickle1021 · reddit · 2026-08-01

开发者在 A100 (40GB VRAM) 上使用 unsloth 的 GGUF 格式实测了 DeepSeek-V4-Flash-0731。在使用 Q8KXL 量化(162GB)并将所有专家层卸载至 CPU 的情况下,模型生成速度约为 16.1 tok/s,且仅占用了 15.8GB 的显存。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →