单张 4090 成功运行 Deepseek v4 flash Q2 版本

jack_smirkingrevenge · reddit · 2026-08-15

作者分享在单张 RTX 4090 (64GB RAM) 上运行 Deepseek-v4-flash-0731 的 Q2/Q3 量化版实验。通过使用 UnslothAI 的 checkpoint 并配合 Blaze 内核,以及将高频专家模型驻留在 CPU 内存中的技巧,实现了可用速度的推理(约 8 tps)。作者指出偶尔的专家缺失会导致磁盘读取使速度降至 5 tps,未来计划通过 dspark 和更多内存优化,预计将发布相关技术文章。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →