Strix Halo实测Qwen3.8-27B:MTP提速3.1倍,FP4分支29.9 tok/s
deepu105 · reddit · 2026-08-23
作者在 Strix Halo 笔记本(Radeon 8060S,128GB 统一内存)上对 Qwen3.8-27B 做了严格的本地推理基准测试(用 llama.cpp 自带计时,每配置 3 次,验证 85W 满频运行):
核心结果:
- MTP(多 token 预测)效果显著:Q80 量化从 7.3 提到 22.4 tok/s(3.1 倍),draft 接受率 73%
- julianmb/q38rocm FP4 分支更快:29.9 tok/s(达基线 4.1 倍),接受率 84%,显存只需 14.6GB(Q80 为 29GB)
- ROCm 与 Vulkan 解码差距在 1% 以内,但 Vulkan 预填明显慢(209 vs 277 tok/s),ROCm 仍是默认选择
关键观察:
- draft 长度 5 最优(Q80)/6(FP4),后端默认 3 并非最佳,且不随上下文长度变化
- MTP 收益随上下文增长而缩水:空窗口 3.1 倍 → 64k 时 2.2 倍 → 256k 满窗口仅 1.15 倍(KV cache 增大让验证更贵,接受率本身保持)
- 预填从空窗口到 256k 约掉到 1/4(277→75 tok/s);FP4 分支预填衰减更快,128k 时反被 Q80 超过(70 vs 119)——其优势在解码而非提示处理
- 无效尝试:KV cache q80(draft 5 时略差)、关 flash attention(-5%)
- 注意:FP4 分支在不同 draft 设置下补全长度会漂移(同一提示 152-160 token)
测试通过作者的 LlamaStash 工具驱动,flags 可复现。
「Infra」频道最新
- NAS 启动失败复盘:元数据勿放启动盘 — TheZachMueller · 2026-08-23
- 英伟达 NVL72 机架成本或达 800 万美元 — zephyr_z9 · 2026-08-23
- Vertex AI 高额账单无硬性预算上限,用户吐槽只能自建 — MeetingWeird9418 · 2026-08-23
- 开源 MCP 服务器实现 HTTP 402 微支付网关 — EstablishmentTough18 · 2026-08-23
- M2 Ultra 跑 DeepSeek V4 Flash:无损重打包至 141GiB,25.8 t/s 超 M3 Ultra — Agusx1211 · 2026-08-23
- 在 Linux iGPU 上跑 Ollama LFM2.5-2.6B:完整配置教程 — Coolsh0e · 2026-08-23