Strix Halo 运行 Qwen3.8 + MTP 性能实测

betiz0 · reddit · 2026-08-29

作者分享了在 AMD Strix Halo 平台(Ryzen AI MAX+ 395 + Radeon 8060S)上运行 Qwen3.8-Flash-Next 结合 MTP (Multi-Token Prediction) 模型的详细基准测试结果。

测试环境使用了 Ubuntu 26.04 和特定的 llama.cpp 分支。结果显示,预填充速度(PP)平均为 138.61 tokens/s,生成速度(TG)平均为 26.67 tokens/s。作者观察认为,相比 27B 版本,该模型在架构和设计任务(如 OpenSpec 提案)上的输出质量有显著提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →