四卡 7900XTX 跑 27B 提速近一倍,作者公开 20 余项 ROCm 优化

NoFee9147 · reddit · 2026-10-07

网友用 Claude 协助为 ROCm 和 llama.cpp 服务器做了 20 余项底层优化,在 4 张 7900XTX(Lenovo P620,PCIe 4.0 x16)上运行 Qwen3.8-27B Q8,最终代码生成解码从 54-61 提升到 96-110 tok/s,51K 上下文预填充从 1454 到 1816 tok/s。主要优化点:

作者表示若有人感兴趣会推到 GitHub 并分享配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →