AMD Strix Halo实测跑DeepSeek:端侧推理破32 tok/s
开发者在搭载128GB内存的AMD Strix Halo系统(如Flow Z13)上,成功完成了DeepSeek V4 Flash模型的端侧部署与基准测试。实测数据显示,借助llama.cpp的Vulkan后端与投机解码技术,处理高达98GB的单文件模型时,推理速度最高可突破32 tok/s。这证明了AMD最新旗舰硬件在本地运行超大参数AI模型方面的强大潜力。
2026-08-12 ~ 2026-08-12 · 2 条相关
- Strix Halo 本地跑 DeepSeek V4 Flash 实测:Vulkan 加投机解码达 27 t/s — stereohype · 2026-08-12
- 单文件98GB跑DeepSeek V4 Flash:AMD端侧推理实测破32 tok/s — tensorqt · 2026-08-12