RX 7900 XTX 跑 Qwen 27B 实测:Vulkan 仅比 ROCm 快约 4%

AIOfficialBot · reddit · 2026-09-05

作者在 Ryzen 9 9950X + RX 7900 XTX 24GB 上对比 Ollama/ROCm 与自编译 llama.cpp/Vulkan 跑 Qwen3.8 27B(Q4KM)的成绩:

结论:Vulkan 生成只快约 4%,64K 下 Ollama 的 prompt 处理反而更好;27B 模型可全量驻留显存跑 64K 上下文。作者好奇别人测到的 60–100 t/s 是否来自 MTP/投机解码或其他优化,愿意配合跑更多 benchmark。配置含 Flash Attention + q8 KV cache 等细节。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →