llama.cpp Vulkan 融合 Qwen 激活链,推理再提速

jacek2023 · reddit · 2026-09-28

llama.cpp 合入一个针对 Vulkan 后端的 PR(#29520,作者 fxgsell):将 Qwen4exp 的 SCALE→SIGMOID→SCALE→hcpost 激活算子链做算子融合(fuse),减少访存开销。作者称这是 Vulkan 用户的下一波 Qwen 推理提速点,用 Vulkan 跑 Qwen 系列的本地部署者可直接受益。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →