Strix Halo实测:Halogen跑Qwen 3.8最快,预填充1045 tokens/s
deepu105 · reddit · 2026-09-30
作者在AMD Strix Halo(ASUS ROG Flow Z13,Ryzen AI Max+,128GB内存)上系统评测了多款推理引擎运行 Qwen 3.8-Flash-Next 的表现,70W TDP、Arch Linux、LlamaStash 编排。
初筛(64k上下文,32k提示)结果:
- Halogen 0.14.0(闭源,Docker):最快,3轮2.1分钟级别,预填充1045 t/s,解码39.3 t/s,MTP接受率84%
- gufo(开源):紧随其后,冷启动加载快4倍,后续请求首token最快(1.6-1.9s vs 2.6-3.3s)
- CIRU(MTP 3)居第三
- llama.cpp Unsloth 构建(Vulkan/ROCm)明显落后:预填充仅285-314 t/s,总时长4.8-3.7分钟
评测方法:3轮时间为首token+生成1000 tokens累计,每引擎跑2次,并做了7个精确值检索测试(前三名均14/14)。前三名引擎还进一步测试了128k和256k上下文场景。
「Infra」频道最新
- Claude+小模型混合架构,1000次决策成本从605美元降到0.17美元 — jamestagg · 2026-09-30
- Intel 从 Marvell 挖来新任数据中心销售副总裁 — firstadopter · 2026-09-30
- RTX 6000 Pro功耗限制到最低也不影响推理性能 — AlpinDale · 2026-09-30
- 分析师:新云厂商不找企业客户,_GPU 泡沫式互买很反常 — DavidLinthicum · 2026-09-30
- a16z 拆解 25 张图:超大规模资本开支逼近万亿美元 — a16z Podcast · 2026-09-30
- Cloudflare 新 MCP 方案:工具定义从 244K 上下文压到 1.1K — PuzzledFarmer4554 · 2026-09-30