llama.cpp 新增 Vulkan INT8 矩阵乘,7900XTX 预填充提速超 25%
nickm_27 · reddit · 2026-09-24
ggml-org/llama.cpp 合并了针对 AMD RDNA3/RDNA4 的 Vulkan int8 coopmat1 matmul 实现。作者在 7900XTX 上用 gemma4 26B.A4B Q40 实测:pp512 从 3410.5 t/s 提升到 4331.2 t/s,长上下文 d16384 下从 2130 提到 2402 t/s;tg128 也有小幅提升(135.6→142.8 t/s)。对用 AMD 卡跑本地推理的用户是实打实的免费性能提升。
「Infra」频道最新
- Modal 拟以约 150 亿美元估值融资,Baseten 洽谈估值达 260 亿 — nmasc_ · 2026-09-24
- Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 省 40% 质量持平 — sophiamyang · 2026-09-24
- NVIDIA BioNeMo 让蛋白质结构预测吞吐提升 2.9 倍 — AllThingsApx · 2026-09-24
- Liquid AI 发布 DSpark 投机解码,LFM2.5-VL-3B 解码提速至 3 倍 — helloiamleonie · 2026-09-24
- Stripe 发布欧洲创业与算力数据:AI 企业支付额、数据中心容量对比 — jeff_weinstein · 2026-09-24
- 单张 RTX 5090 实测:MiniMax H3 视频生成的各种加速方法 — fruesome · 2026-09-24