DeepSeek-V4-Flash 自定义 IQ3 量化方案:多卡混插提升 40% 解码速度
HockeyDadNinja · reddit · 2026-08-02
开发者针对多 GPU 混合且显存溢出至内存的设备,分享了一套 DeepSeek-V4-Flash-0731 的自定义量化方案(GGUF)。
量化策略
仅对 129 个路由专家张量进行重新量化(降至 IQ3XXS,下投影保持 IQ3S),其余张量(如注意力、共享专家等)保留原始高精度。最终模型大小为 111.37 GiB。
质量与性能对比
- 质量:与 unsloth 的 UD-IQ3S 相比,该方案的 KLD(0.2386 vs 0.2936)和 top-1 一致性更好,但体积略大且最大 KLD 略差。
- 速度:在 5 卡混合(96GB VRAM,专家溢出至 CPU)设备上,解码速度达到 13.91 t/s,比原始 MXFP4 版本快约 1.4 倍。
作者指出,如果纯粹追求速度,更小的 Q2 版本表现更好(30.27 t/s)。此外,DeepSeek-V4-Flash 在 llama.cpp 中存在已知的 SWA 和回滚停顿问题,需使用非官方修复版才能正常运行。
所属事件:DeepSeek-V4-Flash 本地部署实测:多硬件跑分与极限量化方案(14 条相关)→
「Infra」频道最新
- AMD 入局开源大模型:发布 Instella-MoE-16B 推理模型 — airesearch12 · 2026-08-03
- 美国多州拟取消数据中心税收优惠,AI算力成本或面临上升 — pstAsiatech · 2026-08-03
- 低显存跑视频模型太慢?开发者探讨 HuggingFace Pro 订阅的性价比 — Smooth-Telephone9443 · 2026-08-03
- AI 离线推理怎么做?开发者热议批量任务的最佳工程实践 — cmm324 · 2026-08-03
- AI 工程师必看:LLM 推理部署与优化 10 周实战路线图 — _jaydeepkarale · 2026-08-03
- 应用开发者应自研端侧模型:将算力下放给用户 — abacaj · 2026-08-03