Strix Halo 跑 Qwen 3.8 Flash Next:换 gufo 推理,预处理速度翻倍于 llama.cpp 分支

fallingdowndizzyvr · reddit · 2026-09-28

Reddit 用户 w3vic(非项目作者)推荐用开源推理框架 gufu(gufo-org/gufo)在 AMD Strix Halo 上跑 Qwen 3.8 Flash Next,称在高上下文场景下明显快于 llama.cpp。实际聊天中测得 6204 chunks 用时 119 秒,encode 1239 tok/s、decode 57 tok/s(开启 MTP),其中 PP(prefill)速度约为最快的 Strix Halo 专用 llama.cpp 分支的两倍,主线程 llama.cpp 更是远不及。gufo 也支持其他模型,但当前支持列表还较小。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →