DeepSeek V4 Flash 的 KV Cache 量化质量显著下降
erazortt · reddit · 2026-08-03
开发者对 DeepSeek V4 Flash(DS4F)模型将 KV Cache 从 BF16 量化至 Q8 的质量影响进行了详细测试,结果显示其性能出现了显著下降,建议不要对该模型进行 KV 量化。
核心数据对比:
- DS4F:量化后困惑度(PPL)上升,KL 散度(KLD)大幅增加,Top-P 概率一致性仅为 87.189%。
- Qwen 397B:作为对比,Qwen 397B 在同等量化条件下的 KL 散度极小,Top-P 一致性高达 97.929%。
这表明,与部分对量化容忍度较高的模型不同,DeepSeek V4 Flash 对 KV Cache 量化非常敏感,强行量化会导致明显的生成质量受损。
「研究」频道最新
- AlphaFold 曾让博士生崩溃,AI 颠覆下一个目标是数学 — roydanroy · 2026-08-03
- 开源项目 WiFi-3D-Fusion:用 WiFi 信号结合视觉实时估计 3D 人体姿态 — tom_doerr · 2026-08-03
- Gabor 表示建模新进展:gabor_painter 逐笔绘制图像 — pixlpa · 2026-08-03
- ACE-Data-0 发布:150小时多模态具身数据引擎 — liuziwei7 · 2026-08-03
- Armory:单 GPU 同时服务 10+ 机器人,吞吐提升 18% — danfei_xu · 2026-08-03
- AI实验室强化学习任务QA的常见陷阱 — andersonbcdefg · 2026-08-03