Strix Halo实测Qwen3.8-27B:MTP提速3.1倍,FP4分支29.9 tok/s

deepu105 · reddit · 2026-08-23

作者在 Strix Halo 笔记本(Radeon 8060S,128GB 统一内存)上对 Qwen3.8-27B 做了严格的本地推理基准测试(用 llama.cpp 自带计时,每配置 3 次,验证 85W 满频运行):

核心结果:

关键观察:

测试通过作者的 LlamaStash 工具驱动,flags 可复现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →