llama.cpp 合并为 Gemma 26B A4B 优化 flash attention 形状

jacek2023 · reddit · 2026-09-23

ggml-org/llama.cpp 仓库的 PR #28450 针对本地推理优化了 gemma4-26b-a4b 的 flash attention 张量形状,带来可感知的速度提升。

这类底层形状调优是 llama.cpp 社区榨取端侧推理性能的常规手段,对在本地跑 Gemma 系列模型的用户有直接收益,PR 已被提交待合并。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →