DeepSeek V4 量化实测:修复转换隐患与 8×RTX 5090 跑分

gladkos · reddit · 2026-08-12

开发者在 8×RTX 5090 上对 DeepSeek V4 0731 进行了量化并对比了主流方案。文章指出了模型转换过程中的两个隐患:未开启 --no-lazy 会导致权重变为 NaN,以及默认转换器将 FP8 张量降级为 Q80 造成了不可忽视的偏差。

通过将相关张量替换为 BF16,团队实现了与原模型逐位一致的基线。随后,他们使用 imatrix 构建了 13 种量化方案,并强调由于缺乏统一命名标准且不同 GPU 存在推理路径差异,横向对比极为困难。

最终,团队在同一台机器上测试了 38 个量化文件。结果显示,在 85-135 GB 区间内,其量化方案的偏离度整体优于社区主流方案。对于 128 GB 硬件,推荐使用大小为 104 GB 的 AD-IQ2M 量化版本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →