DeepSeek V4 Flash 量化版本本地性能实测:Q3 比 Q8 快数倍

Spicy_mch4ggis · reddit · 2026-08-04

一位开发者在 128GB VRAM 的硬件环境下,对 DeepSeek V4 Flash 的 Unsloth Q8 和 Q3 xxs 量化版本进行了基准测试。

测试结果显示,与需要卸载的 Q8 版本相比,Q3 版本在提示词处理上快了 3.5 倍,在解码上快了 2 倍。作者正在评估这种速度提升是否值得承受质量损失。此外,作者还分享了关于推测解码、200k 上下文表现以及思考预算设置等技术细节的探讨。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →