Strix Halo 本地跑 DeepSeek V4 Flash 实测:Vulkan 加投机解码达 27 t/s

stereohype · reddit · 2026-08-12

作者在 Flow Z13(Ryzen AI MAX+ 395, 128GB)上对 DeepSeek V4 Flash 0731 进行了深度基准测试。通过 llama.cpp 的 Vulkan 后端结合 DSpark 投机解码,实现了 26.76 t/s 的持续解码速度和 236 t/s 的 prefill 速度。

跨平台对比

关键踩坑经验

所属事件:AMD Strix Halo实测跑DeepSeek:端侧推理破32 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →