DeepSeek V4 Flash 量化版本本地性能实测:Q3 比 Q8 快数倍
Spicy_mch4ggis · reddit · 2026-08-04
一位开发者在 128GB VRAM 的硬件环境下,对 DeepSeek V4 Flash 的 Unsloth Q8 和 Q3 xxs 量化版本进行了基准测试。
测试结果显示,与需要卸载的 Q8 版本相比,Q3 版本在提示词处理上快了 3.5 倍,在解码上快了 2 倍。作者正在评估这种速度提升是否值得承受质量损失。此外,作者还分享了关于推测解码、200k 上下文表现以及思考预算设置等技术细节的探讨。
「Infra」频道最新
- 为什么“2nm”只是制程代号,不是晶体管真实尺寸 — JosephJacks_ · 2026-08-04
- chapter-tgz 给 tar.gz 加章节边界,支持 O(1) 跳过和并行读取 — charliermarsh · 2026-08-04
- 二手 R940 加双 3090 跑起 DeepSeek V4-Flash,33 tok/s — AbbreviationsSad5582 · 2026-08-04
- NVIDIA:长上下文模型速度上限由训练前架构选择决定 — NVIDIAAI · 2026-08-04
- MiniMax H3 全量 bf16 跑满 95GB 显存,15 秒视频耗时 2 小时 — Moarkush · 2026-08-04
- 重置 Windows 后,RTX 3070 的本地 Qwen3.6-35B 吞吐恢复了 — campaigner_ · 2026-08-04