Strix Halo 跑 Qwen 3.8 Flash Next:换 gufo 推理,预处理速度翻倍于 llama.cpp 分支
fallingdowndizzyvr · reddit · 2026-09-28
Reddit 用户 w3vic(非项目作者)推荐用开源推理框架 gufu(gufo-org/gufo)在 AMD Strix Halo 上跑 Qwen 3.8 Flash Next,称在高上下文场景下明显快于 llama.cpp。实际聊天中测得 6204 chunks 用时 119 秒,encode 1239 tok/s、decode 57 tok/s(开启 MTP),其中 PP(prefill)速度约为最快的 Strix Halo 专用 llama.cpp 分支的两倍,主线程 llama.cpp 更是远不及。gufo 也支持其他模型,但当前支持列表还较小。
「Infra」频道最新
- 美国 AI 数据中心投资占 GDP 比重已超当年铁路与公路之和 — rvp · 2026-09-28
- FailureAtlas 论文:多厂商 LLM 网关最致命的故障是静默返回 HTTP 200 — its_vayishu · 2026-09-28
- 二手 RTX 3090 涨到近 1500 美元,买家直呼像 GPU 抢椅子游戏 — sleight42 · 2026-09-28
- 爬虫服务 p50 稳定 2 秒,作者强调应用与数据库必须同区部署 — DanielLockyer · 2026-09-28
- 北大开源 RayOrch:数据准备管线最高提速 15.14 倍 — PekingUniversity · 2026-09-28
- 算力生意里为什么信用质量最关键:集群不透明,只能盯出钱的人 — AccBalanced · 2026-09-28