AMD Strix Halo实测跑DeepSeek:端侧推理破32 tok/s

开发者在搭载128GB内存的AMD Strix Halo系统(如Flow Z13)上,成功完成了DeepSeek V4 Flash模型的端侧部署与基准测试。实测数据显示,借助llama.cpp的Vulkan后端与投机解码技术,处理高达98GB的单文件模型时,推理速度最高可突破32 tok/s。这证明了AMD最新旗舰硬件在本地运行超大参数AI模型方面的强大潜力。

2026-08-12 ~ 2026-08-12 · 2 条相关