DeepSeek V4 Flash 预填充提速方案:降级 CUDA 至 13.1
fragment_me · reddit · 2026-08-03
针对 DeepSeek V4 Flash 在处理 prefill/pp 时速度不佳的问题,作者分享了两种有效的提速方案(可提升 100-150 t/s)。
- 方案一(推荐):将 CUDA 从 13.3 降级至 13.1。因为从 13.2 版本开始,系统默认使用 DeviceTopK 替代 argsort 进行 top-k 运算,这会导致 PP 速率大幅下降。
- 方案二:如果必须使用 CUDA 13.3,可以使用一个经过修改的 fork 版本。
作者分析指出,DS4 Flash 目前将大量时间消耗在了矩阵乘法以外的操作上。
「Infra」频道最新
- 30B视频MoE模型量化版实测:多数人暂不建议折腾 — EntireBig7258 · 2026-08-03
- AI数据中心年耗水量可达15亿加仑 — AndyMasley · 2026-08-03
- 备战本地大模型推理:极客组装 30TB SSD 与 256GB 内存 — reto-wyss · 2026-08-03
- 分析师预计CPO封装技术2028年前难实现大批量出货 — BenBajarin · 2026-08-03
- 康奈尔大学发布并行计算与高性能计算学习路线图 — thehiphopswami · 2026-08-03
- 单台 DGX Spark 跑满 DeepSeek V4 Flash 155G:2-bit 量化与 MTP 提速实测 — Puzzleheaded_Base302 · 2026-08-03