llama.cpp Vulkan 融合 Qwen 激活链,推理再提速
jacek2023 · reddit · 2026-09-28
llama.cpp 合入一个针对 Vulkan 后端的 PR(#29520,作者 fxgsell):将 Qwen4exp 的 SCALE→SIGMOID→SCALE→hcpost 激活算子链做算子融合(fuse),减少访存开销。作者称这是 Vulkan 用户的下一波 Qwen 推理提速点,用 Vulkan 跑 Qwen 系列的本地部署者可直接受益。
「Infra」频道最新
- MLX 的 MoE 层提速 1.5 倍,靠 grouped mm 瓦片调度优化 — awnihannun · 2026-09-28
- Cloudflare 多租户存储事故:删除卷未清零,24 个容器中 18 个残留他人数据 — arpit_bhayani · 2026-09-28
- RTX 5090 本地编码模型怎么选:Qwen 27B 200TPS 与 Flash 50TPS 之间找平衡 — MasterNomie · 2026-09-28
- Lumen 推出按需弹性专线:最高 100 Gbps 覆盖千万美国站点 — shashib · 2026-09-28
- 本地AI分两类:笔记本端触达大众与企业级部署各司其职 — TheZachMueller · 2026-09-28
- Cloudflare Kitesurf 更新:支持 WebMCP,WPT 通过 73 万子测试 — Cloudflare Blog · 2026-09-28