DeepSeek V4 Flash 量化实测
CoplanarDimension · reddit · 2026-07-18
这篇 Reddit 帖是在本机上实测 **DeepSeek V4 Flash** 的 GGUF 量化版本,并对比了两个 llama.cpp 实现:`fairydreaming/llama.cpp dsv4 fork` 和主线 `llama.cpp b10064`。 ### 测试配置 - **硬件**:Ryzen 5950X、128GB DDR4、RTX 3090 24GB、Windows 11 Pro - **模型**:`DeepSeek-V4-Flash.IQ3_XXS-AS.gguf` 与 `DeepSeek-V4-Flash.IQ2_S.gguf` - **统一参数**:`llama-server`,上下文 196608,开启 flash-attn,`--no-mmap`,KV cache 采用 `q8_0` ### 主要结果 - 在 **fork** 上,`IQ2_S` 的 prompt 处理略快于 `IQ3_XXS-AS`(冷启动约快 7%),但 warm 场景下两者 prompt 吞吐几乎相同,约 **254 tok/s**。 - **生成速度** 上,`IQ2_S` 始终更快,约比 `IQ3_XXS-AS` 快 **18%~19%**。 - 作者的结论是:`IQ3_XXS-AS` 才是更好的甜点位,虽然 `IQ2_S` 生成更快,但质量差异更值得关注。 ### fork vs 主线 同一模型 `IQ3_XXS-AS` 在主线 `b10064` 上复测后: - **冷启动 prompt**:fork 更快(262.66 tok/s vs 227.38 tok/s) - **生成速度**:主线略快(11.88 tok/s vs 11.42 tok/s) - warm 场景下差距缩小,prompt 基本接近,生成仍是主线略占优 作者最后的意思是:这个 dsv4 fork 在当前测试里已经没什么必要了。
所属事件:开发者实测双3080本地运行DeepSeek量化版(2 条相关)→
「Infra」频道最新
- JoyNexus 把 VLA 后训练做成多租户共享服务 — Haoran Sun · 2026-07-21
- ComfyUI 变慢或因模型反复读盘,而非硬件故障 — J6j6 · 2026-07-21
- Opta 世界杯预测看似封神,核心其实是数据和模拟 — APPSO · 2026-07-21
- TokenPrint 把 Qwen 推理做成 DevTools 式调试器 — Rich-Fruit-326 · 2026-07-21
- 路由故障让 Claude Code 智能体 3.5 小时烧掉 3020 万 token — RileyRalmuto · 2026-07-21
- 单集群可扩至50万卡,华为Atlas 950 SuperPoD算力架构曝光 — pstAsiatech · 2026-07-21