llama.cpp 新增 Vulkan INT8 矩阵乘,7900XTX 预填充提速超 25%

nickm_27 · reddit · 2026-09-24

ggml-org/llama.cpp 合并了针对 AMD RDNA3/RDNA4 的 Vulkan int8 coopmat1 matmul 实现。作者在 7900XTX 上用 gemma4 26B.A4B Q40 实测:pp512 从 3410.5 t/s 提升到 4331.2 t/s,长上下文 d16384 下从 2130 提到 2402 t/s;tg128 也有小幅提升(135.6→142.8 t/s)。对用 AMD 卡跑本地推理的用户是实打实的免费性能提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →