DeepSeek V4 Flash 量化实测

CoplanarDimension · reddit · 2026-07-18

这篇 Reddit 帖是在本机上实测 **DeepSeek V4 Flash** 的 GGUF 量化版本,并对比了两个 llama.cpp 实现:`fairydreaming/llama.cpp dsv4 fork` 和主线 `llama.cpp b10064`。 ### 测试配置 - **硬件**:Ryzen 5950X、128GB DDR4、RTX 3090 24GB、Windows 11 Pro - **模型**:`DeepSeek-V4-Flash.IQ3_XXS-AS.gguf` 与 `DeepSeek-V4-Flash.IQ2_S.gguf` - **统一参数**:`llama-server`,上下文 196608,开启 flash-attn,`--no-mmap`,KV cache 采用 `q8_0` ### 主要结果 - 在 **fork** 上,`IQ2_S` 的 prompt 处理略快于 `IQ3_XXS-AS`(冷启动约快 7%),但 warm 场景下两者 prompt 吞吐几乎相同,约 **254 tok/s**。 - **生成速度** 上,`IQ2_S` 始终更快,约比 `IQ3_XXS-AS` 快 **18%~19%**。 - 作者的结论是:`IQ3_XXS-AS` 才是更好的甜点位,虽然 `IQ2_S` 生成更快,但质量差异更值得关注。 ### fork vs 主线 同一模型 `IQ3_XXS-AS` 在主线 `b10064` 上复测后: - **冷启动 prompt**:fork 更快(262.66 tok/s vs 227.38 tok/s) - **生成速度**:主线略快(11.88 tok/s vs 11.42 tok/s) - warm 场景下差距缩小,prompt 基本接近,生成仍是主线略占优 作者最后的意思是:这个 dsv4 fork 在当前测试里已经没什么必要了。

所属事件:开发者实测双3080本地运行DeepSeek量化版(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →