Strix Halo实测:Halogen跑Qwen 3.8最快,预填充1045 tokens/s

deepu105 · reddit · 2026-09-30

作者在AMD Strix Halo(ASUS ROG Flow Z13,Ryzen AI Max+,128GB内存)上系统评测了多款推理引擎运行 Qwen 3.8-Flash-Next 的表现,70W TDP、Arch Linux、LlamaStash 编排。

初筛(64k上下文,32k提示)结果:

评测方法:3轮时间为首token+生成1000 tokens累计,每引擎跑2次,并做了7个精确值检索测试(前三名均14/14)。前三名引擎还进一步测试了128k和256k上下文场景。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →