RX 7900 XTX 跑 Qwen 27B 实测:Vulkan 仅比 ROCm 快约 4%
AIOfficialBot · reddit · 2026-09-05
作者在 Ryzen 9 9950X + RX 7900 XTX 24GB 上对比 Ollama/ROCm 与自编译 llama.cpp/Vulkan 跑 Qwen3.8 27B(Q4KM)的成绩:
- 64K 上下文:Ollama prompt 处理 215.8 t/s、生成 34.4 t/s;Vulkan prompt 192.0 t/s、生成 35.8 t/s
- 8K 上下文:Vulkan prompt 230.5 t/s、生成 36.0 t/s
- 上下文从 64K 降到 8K,解码速度几乎不变(35.8→36.0 t/s)
结论:Vulkan 生成只快约 4%,64K 下 Ollama 的 prompt 处理反而更好;27B 模型可全量驻留显存跑 64K 上下文。作者好奇别人测到的 60–100 t/s 是否来自 MTP/投机解码或其他优化,愿意配合跑更多 benchmark。配置含 Flash Attention + q8 KV cache 等细节。
「Infra」频道最新
- Reddit热议:数据墙逼近,Test-Time Compute成行业新范式 — erdematar · 2026-09-05
- 腾讯混元 Hy4 预览:770B 总参 49B 激活,原生 1M 上下文 Apache 2.0 — aftahi_ai · 2026-09-05
- Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价 — ChopSticksPlease · 2026-09-05
- Speechify CEO 谈自建数据中心、被 ElevenLabs 反超与千万美元人才战 — 20VC · 2026-09-05
- 他把本地 LLM 当 3D 打印机用:一年自写 12 个游戏、29 个游戏 Mod — Quebber · 2026-09-05
- 算力变现效率差 5 倍:智谱每兆瓦仅 800-1000 万美元,Anthropic/OpenAI 达 4000-5000 万 — zephyr_z9 · 2026-09-05