DeepSeek V4 Flash 装进 128GB Ryzen AI 平台,跑到 32 tok/s
sandropuppo · reddit · 2026-07-28
这条 Reddit 详细展示了如何把 DeepSeek V4 Flash 塞进一台 AMD Ryzen AI MAX+ 395、128GB 统一内存 的机器里,并跑出最高 32 tok/s 的解码速度。
主要信息包括:
- 作者用 ROCmFPX 系列块量化格式做了混合精度压缩,把目标模型压到 102.3 GB,约合 2.88 bits/参数。
- 在没有 speculative draft 的情况下,针对 DeepSeek 的 HIP 解码路径能达到 25.31 tok/s。
- 加上小型 DSpark draft 和 q=4 验证上限后,吞吐提升到 32.0 tok/s。
- Sparse prefill 方面,公开跑分约 245 tok/s;另一次验证在 8K 左右上下文里落在 246.8–255.9 tok/s。
作者也说明,sparse prefill 因为 reduction 顺序不同于逐 token 精确预填充,所以是可选模式;不过小规模 smoke test 已通过。
「Infra」频道最新
- Recursive Superintelligence 与 AWS 签下 4.1 亿美元算力协议 — ChengleiSi · 2026-07-29
- Intel 将 14A 制程提前至 2027 年风险试产 — Beth_Kindig · 2026-07-29
- Arav 说 AI 时代的新美国梦是拥有数据中心 — AravSrinivas · 2026-07-29
- SGLang 称 Kimi K3 上线即达 423 tok/s,推理栈深度优化 — ying11231 · 2026-07-29
- NVIDIA 推出 Jetson 本地运行生成式 AI 的指南 — NVIDIAAI · 2026-07-28
- ZML 推出免费推理服务器,可跨 Nvidia、AMD 和 TPU 跑大模型 — emmanuelvivier · 2026-07-28