单张 4090 成功运行 Deepseek v4 flash Q2 版本
jack_smirkingrevenge · reddit · 2026-08-15
作者分享在单张 RTX 4090 (64GB RAM) 上运行 Deepseek-v4-flash-0731 的 Q2/Q3 量化版实验。通过使用 UnslothAI 的 checkpoint 并配合 Blaze 内核,以及将高频专家模型驻留在 CPU 内存中的技巧,实现了可用速度的推理(约 8 tps)。作者指出偶尔的专家缺失会导致磁盘读取使速度降至 5 tps,未来计划通过 dspark 和更多内存优化,预计将发布相关技术文章。
「Infra」频道最新
- 寒武纪半年报:营收翻倍但增长降速,估值预支数倍扩张 — 量子位 · 2026-08-15
- Qwen3.8-27B 免费公测端上线:支持262K上下文与视觉 — victormustar · 2026-08-15
- AI 基础设施新解:用分片技术让 768 台服务器如一台运作 — blaizedsouza · 2026-08-15
- AWS 工程师详述可扩展控制平面构建难题与实战 — blaizedsouza · 2026-08-15
- 本地AI硬件门槛高:高端GPU价格超多数人预算 — rosie254 · 2026-08-15
- JAX-QNN 发布: JAX 可直连高通 Hexagon NPU — carrycooldude · 2026-08-15