Qwen3.8-27B 在 AMD Strix Halo 上跑出 31t/s
stereohype · reddit · 2026-08-20
在搭载 Ryzen AI Max+ 395 和 Radeon 8060S 的设备上,作者通过 DFlash2 推测解码方案和 Vulkan 后端,成功让 Qwen3.8-27B (Q5KXL) 在 80W 功耗下达到 31.4 t/s 的解码速度,预填充速度约 300 t/s。实测表明,DFlash2 比内置 MTP 快 40%,且在此配置下 Q5 量化比 Q4 更快(因更高的接受率抵消了带宽开销)。文章提供了完整的启动命令和优化建议。
「Infra」频道最新
- Qwen3.8-27B 实测:KV Cache 量化至 Q4 显著影响思维质量 — fbms2 · 2026-08-20
- DGX Spark 带宽受限,博主权衡用 RTX 5090 提速 — daniel_mac8 · 2026-08-20
- 延迟 1.5 年损毁 8.9% 价值,AI 数据中心速度为王 — Beth_Kindig · 2026-08-20
- 澄清:OpenAI 20% 算力用于监测是误解 — sjgadler · 2026-08-20
- SkyPilot 联手 VAST Data 等举办 AI 基础设施聚会 — skypilot_org · 2026-08-20
- PolymathicAI 发布 15TB 物理模拟数据集 The Well — tom_doerr · 2026-08-20