开发者用 ik_llama.cpp 量化 DeepSeek V4 Flash,65GB 起配对 KLD 实测胜 Atomic
KeinNiemand · reddit · 2026-08-28
社区开发者 KeinNiemand 为 DeepSeek V4 Flash 0731 制作了一整套 ikllama.cpp GGUF 量化(从 65.1GB 的 XSIQ1KT 到 149.1GB 的 IQ4KSS),并发布在 Hugging Face。
量化细节
- 使用重要性矩阵制作;MXFP4 路由张量从原生表示直接重量化,FP8 张量先扩展为 BF16 再量化。
- 需要 ikllama.cpp 新构建版本,主 llama.cpp 无法直接加载这些 IK 专有 IQK/IQT 张量类型。
配对质量测试
作者利用 AtomicChat 公布的无损 BF16 参考 logits 与 WikiText-2 token,在完全相同的本地环境(同一可执行文件、batching、tensor split、上下文长度)对比 PPL、平均 KLD、RMS delta-p 和 top-1 一致率:
- 约 93GB 档:IQ2KS 与 Atomic AD-IQ2S 尺寸相当,但平均 KLD 低 8.35%、PPL 低 0.100、top-1 一致率高 0.92 个百分点。
- 约 73GB 档:IQ1KT 平均 KLD 比 Atomic AD-IQ1MXL 低 19.03%。
结论与提醒
- 作者认为 IQ1KT 和 IQ2KS 可能是当前 73GB/93GB 档最好的质量-体积选择之一,但只测了两个对比点,措辞谨慎;两个 Atomic 文件跑出无效结果被主动排除;IQ3KS/IQ3K/IQ4KSS 因显存不足未做 KLD 测试。
- 内存规划提醒:不要把 GGUF 文件大小当作总需求,还需给 KV cache、运行时缓冲、操作系统和未放入 GPU offload 的张量留空间。93GB 档默认推荐 IQ2KS(IQ2KT 质量相近但 CPU/混合推理更慢)。
「Infra」频道最新
- 三张 R9700 32GB 才抵一张 5090:本地玩家纠结换 AMD 阵营 — MrHall · 2026-08-28
- Vulkan 比 CUDA 低温 20 度还快:llama.cpp 后端选择实测心得 — Hot-Employ-3399 · 2026-08-28
- DeepSeek V4 Flash 定价疑云:如何做到与 GPT OSS 20B 持平? — gajesh · 2026-08-28
- Qwen3.8-Flash 训练成本仅需 Qwen3.7-Plus 九分之一 — VraserX · 2026-08-28
- 主权 AI 市场达 1.5 万亿,企业正逃离美云 — mikeflache · 2026-08-28
- ComfyUI 双卡部署实践:文本与 VAE 一卡、扩散模型一卡 — hurdurdur7 · 2026-08-28