Strix Halo 运行 Qwen3.8 + MTP 性能实测
betiz0 · reddit · 2026-08-29
作者分享了在 AMD Strix Halo 平台(Ryzen AI MAX+ 395 + Radeon 8060S)上运行 Qwen3.8-Flash-Next 结合 MTP (Multi-Token Prediction) 模型的详细基准测试结果。
测试环境使用了 Ubuntu 26.04 和特定的 llama.cpp 分支。结果显示,预填充速度(PP)平均为 138.61 tokens/s,生成速度(TG)平均为 26.67 tokens/s。作者观察认为,相比 27B 版本,该模型在架构和设计任务(如 OpenSpec 提案)上的输出质量有显著提升。
「Infra」频道最新
- MacBook M5 Max 跑 Qwen 350K 上下文实测 — Artistic_Okra7288 · 2026-08-30
- 开发者 Azure Linux 4.0 桌面化实测:预装 PowerShell 与 Copilot — unixterminal · 2026-08-30
- 黄仁勋:先造技术再找问题,算力统一物理与生物 — r0ck3t23 · 2026-08-30
- 如何从零构建 LLM 推理引擎:拆解 5 层架构 — glenbeer · 2026-08-30
- 华勤预计 2026H2 超级节点收入破百亿,三大云厂商下巨额订单 — zephyr_z9 · 2026-08-30
- 英伟达日赚 10 亿美元,几年前的商业神话照进现实 — shauntrennery · 2026-08-30