Strix Halo 本地跑 DeepSeek V4 Flash 实测:Vulkan 加投机解码达 27 t/s
stereohype · reddit · 2026-08-12
作者在 Flow Z13(Ryzen AI MAX+ 395, 128GB)上对 DeepSeek V4 Flash 0731 进行了深度基准测试。通过 llama.cpp 的 Vulkan 后端结合 DSpark 投机解码,实现了 26.76 t/s 的持续解码速度和 236 t/s 的 prefill 速度。
跨平台对比
- 在不使用投机解码的情况下,Strix Halo 与 DGX Spark 的原始解码速度相近(15.7 vs 14.2 t/s),因为两者都受限于内存带宽。
- 开启 DSpark 后,两者速度依然紧咬(26.76 vs 27.3 t/s)。DGX Spark 在 prefill 阶段凭借 tensor-core GEMM 占据绝对优势。
关键踩坑经验
- KV Cache 量化:在长文本生成中,q80 KV 表现优于 f16(22.7 vs 19.3 t/s),不仅减半了带宽压力,还将上下文翻倍至 131k。
- Draft 模型精度:Draft 模型必须使用 bf16(约 11GB),使用量化版会导致 token ID 无效崩溃。
- Vulkan 优于 ROCm:在 gfx1151 架构上,ROCm 尚不成熟,Vulkan + RADV 是目前的最佳选择。
所属事件:AMD Strix Halo实测跑DeepSeek:端侧推理破32 tok/s(2 条相关)→
「Infra」频道最新
- CoreWeave 获 26 亿美元信贷,押注英伟达 GPU 长期价值 — OnlineInference · 2026-08-12
- poolside 举办 Laguna 模型加速赛,社区将其推理速度提升 2.6 倍 — gajesh · 2026-08-12
- 沙箱成为新无服务器原语:AI Agent 改变了底层架构 — s4chinraja · 2026-08-12
- Anthropic联手麦格理与GIC成立数据中心公司 — Beth_Kindig · 2026-08-12
- 优化存储类与生命周期规则,成功削减 80% 冷检索成本 — DanielLockyer · 2026-08-12
- 数据中心扎堆全美最富县城:带动税收暴增连年降税 — sudoraohacker · 2026-08-12