DeepSeek-V4-Flash 自定义 IQ3 量化方案:多卡混插提升 40% 解码速度

HockeyDadNinja · reddit · 2026-08-02

开发者针对多 GPU 混合且显存溢出至内存的设备,分享了一套 DeepSeek-V4-Flash-0731 的自定义量化方案(GGUF)。

量化策略

仅对 129 个路由专家张量进行重新量化(降至 IQ3XXS,下投影保持 IQ3S),其余张量(如注意力、共享专家等)保留原始高精度。最终模型大小为 111.37 GiB。

质量与性能对比

作者指出,如果纯粹追求速度,更小的 Q2 版本表现更好(30.27 t/s)。此外,DeepSeek-V4-Flash 在 llama.cpp 中存在已知的 SWA 和回滚停顿问题,需使用非官方修复版才能正常运行。

所属事件:DeepSeek-V4-Flash 本地部署实测:多硬件跑分与极限量化方案(14 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →