DeepSeek V4 Flash 2-bit 量化版本地跑出 100% SQL 评测
grumd · reddit · 2026-08-04
开发者 grumd 在双卡 RTX 3080 + 96GB RAM 环境下,使用定制的 IQ2M GGUF 量化方案成功在本地运行 DeepSeek V4 Flash。
- 评测成绩:在贴近真实场景的 SQL benchmark 中,该模型成为首个能在本地运行并取得 100% 正确率的模型。此前榜单上只有 Opus 4.7 和 GPT-5.5 达到过满分。
- 推理优化:通过移植部分 tensor 并使用修改版的 ds4 推理引擎,跑出了 300pp 和 11-12 tg 的性能表现,远超原生 llama.cpp 的速度。
- 榜单对比:Qwen3.6-27B 和 Qwen3.5-122B 等其他主流本地量化模型得分均在 24 分及以下(满分 25)。
所属事件:DeepSeek V4 Flash 量化实测:低精度版本大幅提速且无损质量(2 条相关)→
「Infra」频道最新
- Mach-1模型1.7比特权重推理:7GB显存跑出120 tokens/秒 — pbaylies · 2026-08-04
- 用 Rust 给开源模型做手术:极致优化推理性能的实践分享 — doodlestein · 2026-08-04
- Anthropic向成立仅半年的云初创Volta锁定百亿美元算力 — The Decoder · 2026-08-04
- Ling-3.0-flash 开源:127B 参数 MoE 架构,官方 FP8 仅需 128GB — derspenti · 2026-08-04
- 美拟禁中国光模块,博主称反将助推国产 AI 硬件升级 — bookwormengr · 2026-08-04
- 8x 5090 跑 DeepSeek V4 Flash:并发 50 且成本仅 2.5 美元/时 — Hodler-mane · 2026-08-04